cassionAnalyse de données

Parcours

Data scientist pour les ONG

Pour le data scientist qui travaille là où la contrainte n'est pas le modèle mais la décision — petits échantillons, règles de ciblage contestables, et prédictions sur lesquelles une personne agit en se rendant dans un ménage.

Avancé20 cours362 h

Compétences

Avant de commencer

Fait suite àAnalyste de donnéesCe parcours suppose celui-ci acquis plutôt que d'en reprendre les formations.

L'itinéraire

  1. Étape 1

    Asseoir les chiffres

    Savoir ce que compte la variable cible avant d'y ajuster quoi que ce soit, car un modèle hérite de chaque ambiguïté de son étiquette.

  2. Étape 2Au choix

    Choisir le langage de votre équipe

    Approfondir Python ou R. Python s'impose là où un modèle doit être déployé ; R convient mieux là où le travail est une analyse remise à des statisticiens.

    Ce sont des alternatives, pas une séquence. Prenez celui que votre équipe utilise déjà : le second s'acquiert bien plus vite une fois le premier maîtrisé.

  3. Étape 3

    Rendre les données fiables

    Transformer un export brut en un tableau défendable ligne à ligne, et transmettre un journal de nettoyage qui répond à la question de l'auditeur avant qu'elle soit posée.

  4. Étape 4

    Assembler les fichiers

    Réunir plusieurs exports en une table d'analyse défendable colonne par colonne, avec chaque jointure prouvée, chaque granularité énoncée et chaque dénominateur sourcé.

  5. Étape 5

    Contrôler comme un auditeur

    Évaluer vos propres données avant qu'un bailleur ne le fasse — cinq dimensions mesurées, un recomptage face à la source, et un rapport où chaque constat a un responsable et une date.

  6. Étape 6

    Définir ce que vous rapportez

    Rédiger des définitions d'indicateurs que deux analystes calculent de la même façon, défendre le dénominateur, et fixer une référence et une cible qui survivent à une revue à mi-parcours.

  7. Étape 7

    Mettre un intervalle dessus

    Analyser une enquête en grappes comme son plan l'exige — pondérations issues de la base, effet de plan mesuré, et un intervalle qui dit ce que l'échantillon peut trancher et ce qu'il ne peut pas.

  8. Étape 8

    Savoir d'où cela vient

    Lire un système de rapportage de routine comme la base de données qu'il est, tirer une extraction que l'on peut désigner des mois plus tard, et répondre à ce qui a été compté pour tout chiffre qu'il produit.

  9. Étape 9

    L'appliquer à la nutrition

    Porter les méthodes dans un secteur — normes de croissance de l'OMS, plausibilité SMART, phases IPC et seuils de performance Sphere, sur une enquête et un registre de traitement.

  10. Étape 10

    Appliquer à la santé publique

    Des taux à dénominateur en personnes-temps, des cascades de traitement, la couverture de trois façons, et une liste linéaire d'épidémie transformée en courbe, en taux d'attaque et en létalité défendable.

  11. Étape 11

    Appliquer à l'EAH

    Les échelles de service du JMP et les minimums Sphère sur une enquête ménage, puis un registre de suivi à visites répétées qui transforme un taux de fonctionnalité en trois et encadre chacun face aux tournées que personne n'a conduites.

  12. Étape 12

    Appliquer à la sécurité alimentaire

    SCA, ÉFM, ICSR et module d'adaptation construits depuis les composantes brutes et divergeant d'un facteur sept, puis une série de prix dont la saisonnalité éclipse l'effet de programme et le tableau de preuves qui rapporte les deux.

  13. Étape 13

    Appliquer à la protection

    Les analyses qu'il faut refuser de publier, à côté de celles qui comptent — un circuit de référencement conditionné par le consentement, un écart d'équité de dix-neuf points localisé à une porte précise, et une charge de dossiers qui explique deux autres tableaux.

  14. Étape 14

    Appliquer à l'éducation

    Taux brut contre taux net sur un dénominateur projeté, deux chiffres de présence distants de vingt-six points, une cohorte à travers passage et redoublement, et deux passations aux instruments différents.

  15. Étape 15

    Dire votre degré de certitude

    Un intervalle sur chaque proportion, le bon test pour une comparaison, une taille d'effet à côté de chaque valeur p, et le nombre de comparaisons qui ramène deux écoles frappantes au rang de bruit.

  16. Étape 16

    Modéliser plusieurs choses à la fois

    Un coefficient est une comparaison — laquelle, entre quelles unités, ajustée sur quoi. Un rapport de cotes que votre lecteur interprétera de travers, une covariable qui retire 42 % de l'effet, et un modèle qui explique trois pour cent et tranche une décision de ciblage.

  17. Étape 17

    Dire ce qui l'a causé

    Un gain de sept points qui est entièrement l'année scolaire, un groupe de comparaison déséquilibré sur chaque caractéristique mesurée, et l'effet minimal détectable qui a décidé de la réponse avant l'existence de la moindre donnée.

  18. Étape 18

    Le mettre sous leurs yeux

    La marque qu'implique la comparaison, un intervalle qui arrête un classement, une palette qui signifie déjà quelque chose pour ce public, et une figure produite depuis le jeu de données pour que le graphique et la phrase ne puissent pas dériver.

  19. Étape 19

    La rendre réexécutable

    Des données brutes en lecture seule et le code seul édité, un environnement figé pour que l'ordinateur d'un collègue donne vos nombres, des vérifications qui arrêtent la chaîne au lieu d'en produire une fausse et plausible, et une passation sur laquelle un successeur peut agir.

  20. Étape 20

    Le mettre devant la décision

    Une page qui répond à une question plutôt qu'à vingt, le panneau de définitions qui met fin à la dispute mensuelle, et le rapport dont constats, limites et recommandation survivent à une lecture séparée.

Projets recommandés

Modalités d'évaluation

Le plus difficile dans ce métier est rarement la méthode. C’est que la sortie est une liste de ménages nommés, et que quelqu’un va agir dessus.

Cette contrainte élimine beaucoup de choses. Un modèle dont le classement ne peut pas être expliqué ne peut pas être contesté, et une règle de ciblage incontestable le sera quand même — par une autorité de district qui lit la charge de cas comme une affirmation sur qui mérite l’assistance. Le projet sécurité alimentaire présenté ici conclut en rapportant que les ménages déplacés représentent 19 % de la population enquêtée et 33 % de la charge de cas sélectionnée, et qu’aucun terme de déplacement n’apparaît nulle part dans le score. Les deux phrases doivent figurer au rapport.

L’autre habitude que ce parcours construit est d’admettre qu’une frontière est arbitraire. Dans ce même projet, les quarante ménages de part et d’autre du seuil s’étalent sur moins d’un dixième de point, les paires adjacentes diffèrent de quelques millièmes, et rien dans les données ne distingue le dernier ménage inclus du premier exclu. Le dire vaut mieux qu’une précision que les données n’ont pas.

Ce qu’il manque encore à ce parcours

Trois cours sont publiés : Fondamentaux de l’analyse de données, Python pour les données de programme et R et le tidyverse pour les données de programme. Le contenu de modélisation relève du module Statistiques et modélisation de la feuille de route — statistiques appliquées, régression, évaluation d’impact — et rien n’en est encore écrit. Voir le programme.