cassionAnalyse de données

Atelier · Intermédiaire

L'intervalle que l'enquête a réellement acheté

Une enquête SMART à 30 grappes sans pondérations ni base de sondage. Déterminer ce qu'elle permet et ce qu'elle ne permet pas, calculer la MAG avec un intervalle ajusté du plan, et décider si elle peut se lire face au seuil d'urgence de 15 %.

PythonVotre propre machine180 min

Toutes les enquêtes du cours jusqu’ici livraient leur base de sondage. Celle-ci non, et c’est la situation dont vous hériterez réellement — 930 enfants, 30 grappes, quatre équipes, et aucune pondération nulle part.

La question pour laquelle l’enquête existe est de savoir si la malnutrition aiguë a franchi le seuil d’urgence de 15 %. L’estimation ponctuelle se situe juste en dessous. Savoir si l’enquête peut répondre à la question est le constat, et cela dépend entièrement de l’intervalle.

Le fichier

smart-nutrition-survey-2024.v1.csv — 930 enfants de 6 à 59 mois issus d’une enquête SMART à 30 grappes, avec grappe, équipe, poids et taille bruts, position de mesure et œdèmes. Aucun score z et aucune pondération.

Vous aurez aussi besoin de public/datasets/reference/who-2006-weight-for-lenhei.csv pour les paramètres LMS de l’OMS 2006. Le laboratoire du cours sur les jointures traite cette jointure ; ici c’est une étape et non le sujet.

Préparez d’abord

Un dossier de projet, les deux fichiers en lecture seule, un répertoire outputs/, et un script qui s’exécute de bout en bout depuis un interpréteur neuf.

Première partie — quel plan est-ce, et que manque-t-il

Avant tout calcul, écrivez ce que le fichier vous dit du plan de sondage et ce qu’il ne dit pas.

  • L’unité primaire de sondage est enregistrée. Dites laquelle et combien il y en a.
  • Les strates ne le sont pas. Dites ce que cela implique pour votre estimation de variance et dans quel sens l’omission vous égare.
  • Les pondérations ne sont pas là non plus. Les enquêtes SMART sont généralement conçues pour être autopondérées ; énoncez la condition sous laquelle c’est vrai, et dites si quelque chose dans le fichier permet de le vérifier.
  • La base de sondage est absente, donc un ajustement pour non-réponse est impossible. Dites ce qu’il vous faudrait.

Rédigez cela comme un bloc de plan dans la forme employée par le cours. C’est le premier livrable et tout le reste en dépend.

Deuxième partie — l’estimation

Calculez la MAG et la MAS par score z poids-pour-taille, en appliquant les contrôles de plage et le signalement décrits par les notes du jeu de données, et produisez pour chacune :

  • l’estimation ponctuelle, avec le dénominateur analysé énoncé
  • la corrélation intra-grappe et l’effet de plan
  • la taille d’échantillon effective
  • un intervalle de confiance à 95 % tenant compte des grappes
  • le même intervalle calculé comme si l’enquête était un sondage aléatoire simple

Rapportez les deux derniers côte à côte. L’écart entre eux est la raison d’être de ce laboratoire.

Employez l’intervalle logit pour la MAS. L’estimation est assez petite pour que l’intervalle symétrique se comporte mal, et le montrer fait partie de la réponse.

Troisième partie — le seuil

Les notes du jeu de données indiquent qu’une analyse correcte place la MAG près de 14,9 %, juste sous le seuil d’urgence de 15 %.

Répondez à la question pour laquelle l’enquête a été commandée, dans la forme à trois branches du cours — au-dessus, en dessous, ou indécidable — et montrez l’arithmétique qui tranche. Calculez ensuite combien d’enfants il aurait fallu à l’enquête pour trancher, à l’effet de plan que vous avez mesuré.

Quatrième partie — les équipes

Les grappes de l’équipe 3 donnent une MAG proche de 22 % contre 10 à 16 % pour les autres.

  • Estimez la MAG par équipe avec intervalles, et dites si l’écart entre l’équipe 3 et les autres dépasse ce que les intervalles permettent.
  • Dites ensuite pourquoi un écart statistiquement net n’est pas ici un constat nutritionnel, et ce qu’il fait à l’estimation d’ensemble et à son intervalle.

C’est le point où l’analyse d’enquête et l’évaluation de la qualité des données se rejoignent, et la bonne réponse emploie les deux.

Ce qu’il faut rendre

Un script Python, exécuté depuis un interpréteur neuf, produisant :

  • le bloc de plan de la première partie
  • un tableau de résultats avec estimation, dénominateur, ICC, effet de plan, n effectif et les deux intervalles, pour la MAG et la MAS
  • le verdict face au seuil, avec son arithmétique
  • le tableau par équipe avec intervalles
  • le tout écrit dans outputs/

Vérifiez vos chiffres

Attendu
Enfants analysés après contrôles de plage et signalement environ 874
Malnutrition aiguë globale environ 14,9 %
Malnutrition aiguë sévère environ 3,9 %
MAG de l’équipe 3 environ 22 %
MAG des autres équipes 10 % à 16 %

Si votre effet de plan vaut exactement 1,0, vous n’avez pas utilisé la colonne de grappe. Si la MAG est plutôt proche de 12 %, vérifiez d’abord le signe de l’ajustement longueur-taille.

Les questions à traiter en prose

Trois phrases chacune.

1. Vos deux intervalles — ajusté du plan et aléatoire simple — diffèrent. Dites de combien, et ce qu’un lecteur aurait conclu du seuil d’urgence à partir du plus étroit.

2. Aucune pondération n’est livrée. Énoncez la condition sous laquelle une enquête SMART est autopondérée, dites si vous pouvez la vérifier sur ce fichier, et ce que vous écririez en conséquence dans la section des limites.

3. Les grappes de l’équipe 3 sont à 22 %. Expliquez pourquoi les exclure n’est pas évidemment la bonne réponse, ce que leur exclusion fait à l’intervalle autant qu’à l’estimation, et ce que vous recommanderiez au rapport d’enquête.

Comment savoir que c’est fini

Supprimez outputs/, redémarrez l’interpréteur, exécutez une fois, et tous les tableaux se régénèrent à l’identique. Votre tableau de résultats porte un intervalle sur chaque estimation, et aucune estimation n’apparaît nulle part dans votre sortie sans le sien.

Ce que ce laboratoire n’est pas

Ce n’est pas de la méthodologie d’enquête nutritionnelle. Ce que SMART exige d’une enquête, comment se note le rapport de plausibilité et ce que l’IPC fait d’une prévalence relèvent du contenu nutrition. Ce laboratoire porte sur la statistique d’enquête — un plan qu’il faut déduire du fichier, un effet de plan qu’il faut mesurer, un intervalle de la bonne forme, et une réponse honnête à la question de savoir si l’enquête peut trancher ce pour quoi elle a été payée.