cassionAnalyse de données

Parcours

Chargé(e) de recherche

Pour le chargé qui conduit les enquêtes plutôt que de les lire — échantillonnage, estimation tenant compte du plan de sondage, et les tests de plausibilité qui décident si un résultat est publiable.

Avancé20 cours362 h

Compétences

Avant de commencer

L'itinéraire

  1. Étape 1

    Asseoir les chiffres

    Distinguer ce qu'une enquête estime de ce qu'elle mesure, et fixer la désagrégation avant la collecte plutôt qu'après.

  2. Étape 2Au choix

    Choisir le langage de votre équipe

    Approfondir Python ou R. R est le choix le plus répandu en travail d'enquête et celui pour lequel les paquets des standards de croissance de l'OMS sont écrits ; Python vaut mieux si votre équipe en dispose déjà.

    Ce sont des alternatives, pas une séquence. Prenez celui que votre équipe utilise déjà : le second s'acquiert bien plus vite une fois le premier maîtrisé.

  3. Étape 3

    Rendre les données fiables

    Transformer un export brut en un tableau défendable ligne à ligne, et transmettre un journal de nettoyage qui répond à la question de l'auditeur avant qu'elle soit posée.

  4. Étape 4

    Assembler les fichiers

    Réunir plusieurs exports en une table d'analyse défendable colonne par colonne, avec chaque jointure prouvée, chaque granularité énoncée et chaque dénominateur sourcé.

  5. Étape 5

    Contrôler comme un auditeur

    Évaluer vos propres données avant qu'un bailleur ne le fasse — cinq dimensions mesurées, un recomptage face à la source, et un rapport où chaque constat a un responsable et une date.

  6. Étape 6

    Définir ce que vous rapportez

    Rédiger des définitions d'indicateurs que deux analystes calculent de la même façon, défendre le dénominateur, et fixer une référence et une cible qui survivent à une revue à mi-parcours.

  7. Étape 7

    Mettre un intervalle dessus

    Analyser une enquête en grappes comme son plan l'exige — pondérations issues de la base, effet de plan mesuré, et un intervalle qui dit ce que l'échantillon peut trancher et ce qu'il ne peut pas.

  8. Étape 8

    Savoir d'où cela vient

    Lire un système de rapportage de routine comme la base de données qu'il est, tirer une extraction que l'on peut désigner des mois plus tard, et répondre à ce qui a été compté pour tout chiffre qu'il produit.

  9. Étape 9

    L'appliquer à la nutrition

    Porter les méthodes dans un secteur — normes de croissance de l'OMS, plausibilité SMART, phases IPC et seuils de performance Sphere, sur une enquête et un registre de traitement.

  10. Étape 10

    Appliquer à la santé publique

    Des taux à dénominateur en personnes-temps, des cascades de traitement, la couverture de trois façons, et une liste linéaire d'épidémie transformée en courbe, en taux d'attaque et en létalité défendable.

  11. Étape 11

    Appliquer à l'EAH

    Les échelles de service du JMP et les minimums Sphère sur une enquête ménage, puis un registre de suivi à visites répétées qui transforme un taux de fonctionnalité en trois et encadre chacun face aux tournées que personne n'a conduites.

  12. Étape 12

    Appliquer à la sécurité alimentaire

    SCA, ÉFM, ICSR et module d'adaptation construits depuis les composantes brutes et divergeant d'un facteur sept, puis une série de prix dont la saisonnalité éclipse l'effet de programme et le tableau de preuves qui rapporte les deux.

  13. Étape 13

    Appliquer à la protection

    Les analyses qu'il faut refuser de publier, à côté de celles qui comptent — un circuit de référencement conditionné par le consentement, un écart d'équité de dix-neuf points localisé à une porte précise, et une charge de dossiers qui explique deux autres tableaux.

  14. Étape 14

    Appliquer à l'éducation

    Taux brut contre taux net sur un dénominateur projeté, deux chiffres de présence distants de vingt-six points, une cohorte à travers passage et redoublement, et deux passations aux instruments différents.

  15. Étape 15

    Dire votre degré de certitude

    Un intervalle sur chaque proportion, le bon test pour une comparaison, une taille d'effet à côté de chaque valeur p, et le nombre de comparaisons qui ramène deux écoles frappantes au rang de bruit.

  16. Étape 16

    Modéliser plusieurs choses à la fois

    Un coefficient est une comparaison — laquelle, entre quelles unités, ajustée sur quoi. Un rapport de cotes que votre lecteur interprétera de travers, une covariable qui retire 42 % de l'effet, et un modèle qui explique trois pour cent et tranche une décision de ciblage.

  17. Étape 17

    Dire ce qui l'a causé

    Un gain de sept points qui est entièrement l'année scolaire, un groupe de comparaison déséquilibré sur chaque caractéristique mesurée, et l'effet minimal détectable qui a décidé de la réponse avant l'existence de la moindre donnée.

  18. Étape 18

    Le mettre sous leurs yeux

    La marque qu'implique la comparaison, un intervalle qui arrête un classement, une palette qui signifie déjà quelque chose pour ce public, et une figure produite depuis le jeu de données pour que le graphique et la phrase ne puissent pas dériver.

  19. Étape 19

    La rendre réexécutable

    Des données brutes en lecture seule et le code seul édité, un environnement figé pour que l'ordinateur d'un collègue donne vos nombres, des vérifications qui arrêtent la chaîne au lieu d'en produire une fausse et plausible, et une passation sur laquelle un successeur peut agir.

  20. Étape 20

    Le mettre devant la décision

    Une page qui répond à une question plutôt qu'à vingt, le panneau de définitions qui met fin à la dispute mensuelle, et le rapport dont constats, limites et recommandation survivent à une lecture séparée.

Projets recommandés

Modalités d'évaluation

L’estimation est la moitié facile. Une prévalence calculée à la légère et une prévalence calculée avec soin diffèrent souvent de moins que l’intervalle qui entoure l’une ou l’autre, et la décision qui compte n’est généralement pas « quel est le chiffre » mais « ce chiffre est-il publiable ».

Le projet SMART de ce parcours est bâti là-dessus. Son estimation principale est de 14,9 % face à un seuil d’urgence de 15 %, avec un intervalle qui franchit le seuil — l’enquête ne peut donc pas répondre à la question pour laquelle elle a été commandée tant que la question de mesure n’est pas tranchée. Deux tests de plausibilité échouent, dans deux équipes différentes, et un seul des deux défauts déplace l’estimation.

Traiter le plan de sondage comme un détail est la façon la plus courante dont ce travail dérape. La même enquête analysée comme un échantillon aléatoire simple donne un intervalle environ 1,5 fois trop étroit, ce qui placerait tout l’intervalle sous le seuil et produirait une réponse assurée à la mauvaise question.

Ce qu’il manque encore à ce parcours

Trois cours sont publiés : Fondamentaux de l’analyse de données, Python pour les données de programme et R et le tidyverse pour les données de programme. L’échantillonnage et l’estimation relèvent de Analyse d’enquêtes et échantillonnage, dans Indicateurs et mesure, et le contenu inférentiel de Statistiques et modélisation — tous deux à la feuille de route et aucun encore écrit. Voir le programme.