cassionAnalyse de données

Atelier · Intermédiaire

Trois échelles, trois dénominateurs

Rédiger les fiches de référence des échelles de service JMP eau, assainissement et hygiène, les calculer toutes trois à partir d'une enquête ménage, et découvrir que les trois indicateurs ne peuvent pas partager un dénominateur.

RVotre propre machine120 min

Les échelles de service du JMP ressemblent à des catégories. Ce sont des définitions d’indicateurs, et ce laboratoire montre ce qui se passe quand on les traite comme telles — rédigez d’abord la fiche de référence, et l’analyse devient une transcription.

Le piège est dans les dénominateurs. Trois échelles, une enquête, et le dénominateur honnête diffère pour chacune — ce qui signifie que les trois taux de couverture de votre tableau de bord ne peuvent être ni additionnés, ni moyennés, ni comparés entre eux, et que quelqu’un fera les trois.

Le fichier

wash-household-survey-2024.v1.csv — 2 403 entretiens de ménage dans trois districts et dix-huit communautés, couvrant source d’eau, temps de collecte, quantité, analyse au point de collecte, assainissement et hygiène. Synthétique, et il porte un nom de district écrit de quatre façons.

Préparez d’abord

Un projet RStudio, le fichier en lecture seule, un répertoire outputs/, et un script qui s’exécute de bout en bout depuis une session neuve.

Première partie — trois fiches de référence

Avant toute analyse, rédigez une fiche de référence pour chacune des trois échelles, avec les treize champs du cours. Écrivez-les comme données — un fichier JSON ou YAML par indicateur dans indicators/ — et non en prose.

Chaque fiche doit au minimum répondre à ceci.

  • Le numérateur. Quels échelons comptent dans l’indicateur, exactement. Un « service élémentaire d’eau de boisson » est une source améliorée avec un aller-retour de 30 minutes ou moins, et un ménage sur une source améliorée à 45 minutes est en service limité, non élémentaire.
  • Le dénominateur. Tous les ménages, toutes les personnes, ou le sous-échantillon testé — et c’est la règle du cours qui tranche, non la commodité.
  • Les exclusions, avec leurs effectifs.
  • La décision éclairée. Si deux de vos trois fiches nomment la même décision, dites pourquoi les deux indicateurs sont nécessaires.

Deuxième partie — calculez-les à partir des fiches

Votre script doit lire les fiches et produire les indicateurs, de sorte que modifier un seuil dans une fiche modifie la sortie sans toucher à l’analyse.

Quatre obstacles.

Le nom du district. Trois districts arrivent en six. Normalisez face à une liste administrative avant de regrouper, et affirmez le nombre de modalités ensuite.

Le partage des latrines. Un équipement amélioré partagé entre ménages est un service limité, non élémentaire. La colonne est là ; l’oublier gonfle l’assainissement élémentaire.

La taille du ménage manque pour certains ménages. Ce qui compte pour le dénominateur par personne et non pour celui par ménage — les deux indicateurs ont donc des échantillons analysables différents, et les deux chiffres doivent énoncer leur propre n.

La qualité de l’eau est testée sur un sous-échantillon. Environ un tiers des ménages ont un résultat E. coli et environ 40 % une mesure de chlore. Les indicateurs de qualité tournent sur le sous-échantillon testé et ceux d’accès sur l’échantillon entier, et les noms de colonnes doivent dire lequel.

Troisième partie — le tableau des dénominateurs

Produisez un petit tableau qui est le véritable livrable de ce laboratoire.

Indicateur Dénominateur n Valeur
Service élémentaire d’eau de boisson ? ? ?
Service élémentaire d’assainissement ? ? ?
Service élémentaire d’hygiène ? ? ?
Sous le seuil Sphere de 15 L/personne/jour ? ? ?
E. coli détecté au point de collecte ? ? ?

Rédigez ensuite trois phrases sur les raisons pour lesquelles un lecteur ne doit pas comparer la cinquième ligne à la première, et sur ce qu’il faudrait pour que la comparaison soit légitime.

Ce qu’il faut rendre

Un script R, exécuté depuis une session neuve, produisant :

  • trois fiches de référence dans indicators/, lues par le script et non dupliquées dedans
  • le tableau des dénominateurs ci-dessus, chaque cellule remplie et chaque n énoncé
  • la distribution complète de chacune des trois échelles — pas seulement la part « élémentaire » mais tous les échelons, car une échelle qui ne rapporte que son échelon supérieur a jeté le gradient pour lequel elle existe
  • les mêmes taux de couverture calculés au niveau ménage et au niveau personne, côte à côte

Vérifiez vos chiffres

Les notes du jeu de données indiquent ce que trouve une analyse correcte.

Attendu
Sous le seuil Sphere de 15 L/personne/jour environ 13 %
Aller-retour de plus de 30 minutes environ 39 %
Défécation à l’air libre environ 13 %
Service élémentaire d’hygiène environ 34 %

Si votre tableau par district compte plus de trois lignes, la normalisation n’a pas précédé le regroupement. Si l’assainissement élémentaire paraît élevé, shared_sanitation n’est pas dans votre règle de numérateur.

Les questions à traiter en prose

Trois phrases chacune.

1. Vos trois indicateurs d’échelle ont des dénominateurs différents. Nommez-les, dites lequel des trois serait faux à publier comme un unique chiffre de « couverture EAH », et ce que vous publieriez à la place.

2. Environ un quart des ménages sont en service d’eau limité à cause du seul temps de collecte, sur une source améliorée. Expliquez ce que conclurait un programme rapportant sur la seule source, et quelle décision cette erreur enverrait dans le mauvais sens.

3. Les chiffres par personne et par ménage diffèrent de moins d’un point sur cette enquête. Dites pourquoi vous rapporteriez malgré tout celui par personne face au standard Sphere, et décrivez une enquête où l’écart serait grand.

Comment savoir que c’est fini

Supprimez outputs/, redémarrez R, un seul source(), et tous les tableaux se régénèrent à l’identique. Modifier un seuil dans une fiche de référence modifie la sortie sans aucune retouche du script d’analyse — si ce n’est pas le cas, la fiche est de la documentation et non une définition.

Ce que ce laboratoire n’est pas

Ce n’est pas de l’analyse EAH. Pourquoi les échelles sont construites ainsi, ce que le service limité implique pour la santé, et comment le JMP produit des estimations nationales relèvent du contenu EAH. Ce laboratoire porte sur la conception d’indicateurs — des définitions écrites avant le code, des dénominateurs choisis par règle et non par commodité, et un tableau qui dit au lecteur lesquels de vos chiffres peuvent être comparés entre eux.