cassionAnalyse de données

Leçon 8 sur 8

Unité · Ce que l'évaluation affirme

L'évaluation qui décline la question

La commande demandait si la cantine scolaire améliore les apprentissages. La réponse honnête est que ce protocole n'aurait pas pu détecter un effet de l'ampleur qui intéresse le programme, que ce qu'il a détecté est nul, et que les deux affirmations doivent figurer dans le résumé et non en annexe.

PythonR180 minCritères d'évaluation du CAD de l'OCDEDéfinitions d'indicateurs de l'UNICEFNorme humanitaire fondamentale (CHS)Théorie du changement

Rassemblez ce que le cours a produit

Sept leçons, un programme, un fichier. Voici tout ce que l’analyse a établi.

Question Réponse D’où elle vient
Les scores ont-ils monté ? +6,97 pts, IC à 95 % +6,1 à +7,9 Avant-après, leçon 1
Est-ce le programme ? Non — les écoles témoins ont monté de 7,62 Leçon 1
Les groupes sont-ils comparables ? Non — six caractéristiques sur six déséquilibrées Tableau d’équilibre, leçon 2
Quel est l’effet ? −0,96 pt, IC à 95 % −3,5 à +1,6 Différences de différences, leçon 3
L’appariement change-t-il cela ? −0,71 pt, sur 9 des 15 écoles traitées Leçon 4
Un meilleur protocole pourrait-il tourner ? Pas sur ces données — aucun résultat au-delà du seuil Leçon 5
Qu’aurait-il pu détecter ? Rien en dessous de 4,9 points Puissance, leçon 6

Deux de ces sept lignes sont le rapport et les cinq autres sont l’annexe. Le constat est la quatrième ligne et la septième, et c’est la septième qui doit mener.

Le résumé honnête

School feeding and learning outcomes: evaluation summary

  FINDING

  This evaluation cannot answer whether the school feeding programme
  improves literacy, and the reason is in its design rather than its
  results.

  The programme is delivered in 15 schools and compared against 9. With
  fifty children per school and the observed clustering, the smallest
  effect this comparison could have detected is 4.9 percentage points. The
  programme team's threshold for expansion is 3 points. The evaluation was
  therefore incapable of answering the question it was commissioned to
  answer, and this was knowable before it began.

  What it does establish: literacy rose 7.0 points over the school year in
  both programme and comparison schools, with no difference between them
  (-0.96 points, 95% CI -3.5 to +1.6). Effects larger than 3.5 points in
  either direction are ruled out. Effects between 0 and 3 points -- the
  range the programme cares about -- are not.

  RECOMMENDATION

  Do not discontinue the programme on the basis of this evaluation. Do not
  expand it on the basis of the 7-point gain, which is the school year and
  is present in schools without the programme.

  To answer the question, an evaluation needs about 60 schools rather than
  24. If the programme is expanding to new schools, randomising the order of
  the roll-out costs nothing and produces a comparison group that does not
  have to be argued for.

Le premier paragraphe refuse la question et le dernier dit ce qui y répondrait. Entre les deux il y a un constat, un intervalle et une borne, et aucun nombre n’est présenté comme un effet alors qu’il n’en est pas un.

Quatre phrases qu’une évaluation doit pouvoir écrire

Chacune est une vérification du rapport, et un rapport qui ne peut pas produire les quatre a une lacune.

« Le contrefactuel est X. » Ici : les écoles sans programme, supposées avoir suivi la même trajectoire.

« L’estimation vaut Y, avec l’intervalle Z, dans les unités qu’emploie le programme. » Ici : −0,96 point de pourcentage de littératie, −3,5 à +1,6, où 3 points est le seuil d’intérêt.

« Le plus petit effet que ce protocole pouvait détecter vaut W. » Ici : 4,9 points. C’est la phrase qui manque à la plupart des évaluations, et son absence est ce qui permet de lire un résultat nul comme une réfutation.

« Cette analyse ne peut pas écarter V. » Ici : tout effet entre zéro et environ trois points, c’est-à-dire toute la plage sur laquelle le programme discute.

Ce que vaut « aucun effet détecté »

Cela vaut quelque chose, et être précis sur combien fait la différence entre un résultat nul utile et un résultat nul dommageable.

Lecture Étayée ?
« Le programme ne marche pas » Non — le protocole ne pouvait pas détecter l’effet pertinent
« Le programme n’a pas de grand effet sur la littératie » Oui — au-delà de 3,5 points est écarté
« Le gain de 7 points n’est pas attribuable au programme » Oui — les écoles témoins ont monté davantage
« Il faut réorienter le financement » Non — cela exige une estimation d’effet que cette étude n’a pas
« La prochaine évaluation a besoin de 60 écoles » Oui — calculé, et actionnable

Les deux lignes « oui » du milieu sont de vrais constats et ce sont des constats importuns : ils retirent un chiffre phare qu’un programme employait. Le livrer est le travail, et le faire aux côtés de la recommandation de la dernière ligne est ce qui le rend recevable.

Écrire pour le lecteur qui citera une seule phrase

Quelqu’un extraira une ligne de ce rapport et la mettra sur une diapositive. Décidez maintenant laquelle.

Pas : « Aucun effet statistiquement significatif de la cantine scolaire sur la littératie n’a été trouvé. » Vrai, et cela sera lu comme « le programme ne marche pas ».

Pas : « La littératie a monté de 7 points dans les écoles du programme. » Vrai, et cela sera lu comme l’effet.

Ceci : « La littératie a monté de 7 points dans les écoles avec et sans programme ; cette évaluation n’était pas assez grande pour détecter la différence de 3 points qui intéresse le programme. »

Mettez cette phrase dans le résumé, dans la conclusion et dans le courriel d’accompagnement. La phrase citable est choisie par vous ou elle est choisie pour vous.

Ce dont ce cours a traité

Huit leçons et une idée : une affirmation d’impact est une comparaison dont une moitié est absente, et le protocole est l’argumentation sur ce qui la comble.

Chaque méthode présentée — randomisation, différences de différences, appariement, discontinuité — est une argumentation différente pour la même quantité manquante, et chacune est plus ou moins solide selon des faits concernant le déploiement du programme plutôt que selon quoi que ce soit dans l’analyse.

Ce qui signifie que les décisions les plus lourdes de conséquences ont été prises avant l’existence de la moindre donnée : qui a reçu le programme et dans quel ordre, ce qui a été mesuré et sur qui, et combien d’unités ont été affectées. Un analyste qui arrive après choisit parmi les argumentations que le déploiement a laissées disponibles.

La chose utile que ce cours demande n’est donc pas une technique. C’est d’être dans la pièce en janvier, avec une page, à demander comment les écoles seront choisies et si l’ordre peut être randomisé — une question qui ne coûte rien à poser et devient sans réponse un an plus tard.

Rapportez-le en entier

Evaluation of the school feeding programme: methods and limitations

  Design            Difference-in-differences, 15 programme and 9
                    comparison schools, baseline and endline literacy on
                    585 students with both rounds.

  Counterfactual    Comparison schools, assumed to have been on the same
                    trajectory. Two rounds exist, so parallel trends is
                    argued (numeracy shows the same null; no single school
                    drives the result) and not tested.

  Estimate          -0.96 percentage points, 95% CI -3.5 to +1.6,
                    clustered on 24 schools.

  Power             Minimum detectable effect 4.9 points at 80% power,
                    against a 3-point threshold of interest. Underpowered
                    for the relevant effect size.

  Balance           All six baseline characteristics imbalanced beyond 0.25
                    standardised. Adjusted for baseline and district;
                    unmeasured selection is not addressed.

  Attrition         585 of 741 baseline students have an endline. Those who
                    left scored 39.3% at baseline against 56.8% for those
                    who stayed.

  Not claimed       Any effect on attendance, enrolment or nutrition. Any
                    causal effect beyond the difference-in-differences
                    assumption. Any conclusion about effects below 3 points.

  Plan              Written 2024-01-15, one deviation listed in Annex A,
                    three exploratory analyses in Annex B.

Huit lignes, et un relecteur peut reconstituer chaque décision à partir d’elles. C’est le livrable vers lequel ce cours a construit : non pas un nombre, mais un nombre entouré de tout ce dont un lecteur a besoin pour savoir ce qu’il est.

La suite

Le module 5 est complet : l’incertitude, puis les modèles, puis les protocoles. Le module 6 porte sur la restitution — transformer ce que vous avez établi en quelque chose qu’un programme peut voir, employer et reconstruire, c’est-à-dire la dernière chose qui sépare une analyse d’une décision.

Animer cette leçon

La leçon en diaporama, la prose étant reléguée dans les notes du présentateur plutôt que projetée. Produit à partir de cette page, dont il ne peut donc pas s'écarter.

Lancer le diaporamaLire les diapositives

Le PDF ne requiert aucun logiciel et se projette depuis n'importe quel poste. Le fichier PowerPoint est fait pour être modifié : appliquez la charte de votre organisation, retirez une section pour une séance plus courte, ou fusionnez deux leçons en atelier.