Parcours
Data scientist pour les ONG
Pour le data scientist qui travaille là où la contrainte n'est pas le modèle mais la décision — petits échantillons, règles de ciblage contestables, et prédictions sur lesquelles une personne agit en se rendant dans un ménage.
Compétences
Cadrage du problème
AvancéTransformer une question de programme en une analyse assortie d'une décision, et reconnaître quand un modèle est le mauvais instrument.
Indicateurs composites
AvancéConstruire un score à partir de plusieurs indicateurs, énoncer ses hypothèses, et tester si sa conclusion survit au retrait d'une entrée.
Équité du ciblage
AvancéRapporter qui une règle inclut et qui elle exclut, de façon désagrégée, et séparer ce que les indicateurs ont produit de ce qui a été choisi.
Sorties explicables
AvancéProduire un classement ou un signalement sur lequel un travailleur social peut agir et qu'une autorité de district peut contester, sans un modèle que personne ne peut interroger.
Avant de commencer
- Le parcours Analyste de données, ou son équivalent : vous savez déjà nettoyer un export réel et défendre chacune des modifications que vous y avez apportées.
- L'acceptation du fait que le modèle n'est pas le livrable. L'essentiel de la valeur de ce rôle se situe en amont.
Fait suite àAnalyste de donnéesCe parcours suppose celui-ci acquis plutôt que d'en reprendre les formations.
L'itinéraire
Étape 1
Asseoir les chiffres
Savoir ce que compte la variable cible avant d'y ajuster quoi que ce soit, car un modèle hérite de chaque ambiguïté de son étiquette.
Étape 2Au choix
Choisir le langage de votre équipe
Approfondir Python ou R. Python s'impose là où un modèle doit être déployé ; R convient mieux là où le travail est une analyse remise à des statisticiens.
Ce sont des alternatives, pas une séquence. Prenez celui que votre équipe utilise déjà : le second s'acquiert bien plus vite une fois le premier maîtrisé.
Étape 3
Rendre les données fiables
Transformer un export brut en un tableau défendable ligne à ligne, et transmettre un journal de nettoyage qui répond à la question de l'auditeur avant qu'elle soit posée.
Étape 4
Assembler les fichiers
Réunir plusieurs exports en une table d'analyse défendable colonne par colonne, avec chaque jointure prouvée, chaque granularité énoncée et chaque dénominateur sourcé.
Étape 5
Contrôler comme un auditeur
Évaluer vos propres données avant qu'un bailleur ne le fasse — cinq dimensions mesurées, un recomptage face à la source, et un rapport où chaque constat a un responsable et une date.
Étape 6
Définir ce que vous rapportez
Rédiger des définitions d'indicateurs que deux analystes calculent de la même façon, défendre le dénominateur, et fixer une référence et une cible qui survivent à une revue à mi-parcours.
Étape 7
Mettre un intervalle dessus
Analyser une enquête en grappes comme son plan l'exige — pondérations issues de la base, effet de plan mesuré, et un intervalle qui dit ce que l'échantillon peut trancher et ce qu'il ne peut pas.
Étape 8
Savoir d'où cela vient
Lire un système de rapportage de routine comme la base de données qu'il est, tirer une extraction que l'on peut désigner des mois plus tard, et répondre à ce qui a été compté pour tout chiffre qu'il produit.
Étape 9
L'appliquer à la nutrition
Porter les méthodes dans un secteur — normes de croissance de l'OMS, plausibilité SMART, phases IPC et seuils de performance Sphere, sur une enquête et un registre de traitement.
Étape 10
Appliquer à la santé publique
Des taux à dénominateur en personnes-temps, des cascades de traitement, la couverture de trois façons, et une liste linéaire d'épidémie transformée en courbe, en taux d'attaque et en létalité défendable.
Étape 11
Appliquer à l'EAH
Les échelles de service du JMP et les minimums Sphère sur une enquête ménage, puis un registre de suivi à visites répétées qui transforme un taux de fonctionnalité en trois et encadre chacun face aux tournées que personne n'a conduites.
Étape 12
Appliquer à la sécurité alimentaire
SCA, ÉFM, ICSR et module d'adaptation construits depuis les composantes brutes et divergeant d'un facteur sept, puis une série de prix dont la saisonnalité éclipse l'effet de programme et le tableau de preuves qui rapporte les deux.
Étape 13
Appliquer à la protection
Les analyses qu'il faut refuser de publier, à côté de celles qui comptent — un circuit de référencement conditionné par le consentement, un écart d'équité de dix-neuf points localisé à une porte précise, et une charge de dossiers qui explique deux autres tableaux.
Étape 14
Appliquer à l'éducation
Taux brut contre taux net sur un dénominateur projeté, deux chiffres de présence distants de vingt-six points, une cohorte à travers passage et redoublement, et deux passations aux instruments différents.
Étape 15
Dire votre degré de certitude
Un intervalle sur chaque proportion, le bon test pour une comparaison, une taille d'effet à côté de chaque valeur p, et le nombre de comparaisons qui ramène deux écoles frappantes au rang de bruit.
Étape 16
Modéliser plusieurs choses à la fois
Un coefficient est une comparaison — laquelle, entre quelles unités, ajustée sur quoi. Un rapport de cotes que votre lecteur interprétera de travers, une covariable qui retire 42 % de l'effet, et un modèle qui explique trois pour cent et tranche une décision de ciblage.
Étape 17
Dire ce qui l'a causé
Un gain de sept points qui est entièrement l'année scolaire, un groupe de comparaison déséquilibré sur chaque caractéristique mesurée, et l'effet minimal détectable qui a décidé de la réponse avant l'existence de la moindre donnée.
Étape 18
Le mettre sous leurs yeux
La marque qu'implique la comparaison, un intervalle qui arrête un classement, une palette qui signifie déjà quelque chose pour ce public, et une figure produite depuis le jeu de données pour que le graphique et la phrase ne puissent pas dériver.
Étape 19
La rendre réexécutable
Des données brutes en lecture seule et le code seul édité, un environnement figé pour que l'ordinateur d'un collègue donne vos nombres, des vérifications qui arrêtent la chaîne au lieu d'en produire une fausse et plausible, et une passation sur laquelle un successeur peut agir.
Étape 20
Le mettre devant la décision
Une page qui répond à une question plutôt qu'à vingt, le panneau de définitions qui met fin à la dispute mensuelle, et le rapport dont constats, limites et recommandation survivent à une lecture séparée.
Projets recommandés
Modalités d'évaluation
Sait construire un score composite et démontrer que sa sélection est stable au retrait de n'importe quelle composante.
Preuve attendueUne vérification de stabilité rapportée avec le classement, nommant ce qui bouge.
Sait rapporter la composition d'une charge de cas ciblée face à la population enquêtée, de façon désagrégée.
Preuve attendueUn tableau de composition dont les groupes sur- et sous-représentés sont nommés dans le rapport, non seulement calculés.
Sait énoncer là où une frontière de décision n'est pas soutenue par les données.
Preuve attendueUne analyse de frontière montrant les ménages de part et d'autre du seuil et ce qui les sépare.
Le plus difficile dans ce métier est rarement la méthode. C’est que la sortie est une liste de ménages nommés, et que quelqu’un va agir dessus.
Cette contrainte élimine beaucoup de choses. Un modèle dont le classement ne peut pas être expliqué ne peut pas être contesté, et une règle de ciblage incontestable le sera quand même — par une autorité de district qui lit la charge de cas comme une affirmation sur qui mérite l’assistance. Le projet sécurité alimentaire présenté ici conclut en rapportant que les ménages déplacés représentent 19 % de la population enquêtée et 33 % de la charge de cas sélectionnée, et qu’aucun terme de déplacement n’apparaît nulle part dans le score. Les deux phrases doivent figurer au rapport.
L’autre habitude que ce parcours construit est d’admettre qu’une frontière est arbitraire. Dans ce même projet, les quarante ménages de part et d’autre du seuil s’étalent sur moins d’un dixième de point, les paires adjacentes diffèrent de quelques millièmes, et rien dans les données ne distingue le dernier ménage inclus du premier exclu. Le dire vaut mieux qu’une précision que les données n’ont pas.
Ce qu’il manque encore à ce parcours
Trois cours sont publiés : Fondamentaux de l’analyse de données, Python pour les données de programme et R et le tidyverse pour les données de programme. Le contenu de modélisation relève du module Statistiques et modélisation de la feuille de route — statistiques appliquées, régression, évaluation d’impact — et rien n’en est encore écrit. Voir le programme.