Leçon 8 sur 8
Unité · Ce que l'évaluation affirme
L'évaluation qui décline la question
La commande demandait si la cantine scolaire améliore les apprentissages. La réponse honnête est que ce protocole n'aurait pas pu détecter un effet de l'ampleur qui intéresse le programme, que ce qu'il a détecté est nul, et que les deux affirmations doivent figurer dans le résumé et non en annexe.
Rassemblez ce que le cours a produit
Sept leçons, un programme, un fichier. Voici tout ce que l’analyse a établi.
| Question | Réponse | D’où elle vient |
|---|---|---|
| Les scores ont-ils monté ? | +6,97 pts, IC à 95 % +6,1 à +7,9 | Avant-après, leçon 1 |
| Est-ce le programme ? | Non — les écoles témoins ont monté de 7,62 | Leçon 1 |
| Les groupes sont-ils comparables ? | Non — six caractéristiques sur six déséquilibrées | Tableau d’équilibre, leçon 2 |
| Quel est l’effet ? | −0,96 pt, IC à 95 % −3,5 à +1,6 | Différences de différences, leçon 3 |
| L’appariement change-t-il cela ? | −0,71 pt, sur 9 des 15 écoles traitées | Leçon 4 |
| Un meilleur protocole pourrait-il tourner ? | Pas sur ces données — aucun résultat au-delà du seuil | Leçon 5 |
| Qu’aurait-il pu détecter ? | Rien en dessous de 4,9 points | Puissance, leçon 6 |
Deux de ces sept lignes sont le rapport et les cinq autres sont l’annexe. Le constat est la quatrième ligne et la septième, et c’est la septième qui doit mener.
Le résumé honnête
School feeding and learning outcomes: evaluation summary
FINDING
This evaluation cannot answer whether the school feeding programme
improves literacy, and the reason is in its design rather than its
results.
The programme is delivered in 15 schools and compared against 9. With
fifty children per school and the observed clustering, the smallest
effect this comparison could have detected is 4.9 percentage points. The
programme team's threshold for expansion is 3 points. The evaluation was
therefore incapable of answering the question it was commissioned to
answer, and this was knowable before it began.
What it does establish: literacy rose 7.0 points over the school year in
both programme and comparison schools, with no difference between them
(-0.96 points, 95% CI -3.5 to +1.6). Effects larger than 3.5 points in
either direction are ruled out. Effects between 0 and 3 points -- the
range the programme cares about -- are not.
RECOMMENDATION
Do not discontinue the programme on the basis of this evaluation. Do not
expand it on the basis of the 7-point gain, which is the school year and
is present in schools without the programme.
To answer the question, an evaluation needs about 60 schools rather than
24. If the programme is expanding to new schools, randomising the order of
the roll-out costs nothing and produces a comparison group that does not
have to be argued for.
Le premier paragraphe refuse la question et le dernier dit ce qui y répondrait. Entre les deux il y a un constat, un intervalle et une borne, et aucun nombre n’est présenté comme un effet alors qu’il n’en est pas un.
Quatre phrases qu’une évaluation doit pouvoir écrire
Chacune est une vérification du rapport, et un rapport qui ne peut pas produire les quatre a une lacune.
« Le contrefactuel est X. » Ici : les écoles sans programme, supposées avoir suivi la même trajectoire.
« L’estimation vaut Y, avec l’intervalle Z, dans les unités qu’emploie le programme. » Ici : −0,96 point de pourcentage de littératie, −3,5 à +1,6, où 3 points est le seuil d’intérêt.
« Le plus petit effet que ce protocole pouvait détecter vaut W. » Ici : 4,9 points. C’est la phrase qui manque à la plupart des évaluations, et son absence est ce qui permet de lire un résultat nul comme une réfutation.
« Cette analyse ne peut pas écarter V. » Ici : tout effet entre zéro et environ trois points, c’est-à-dire toute la plage sur laquelle le programme discute.
Ce que vaut « aucun effet détecté »
Cela vaut quelque chose, et être précis sur combien fait la différence entre un résultat nul utile et un résultat nul dommageable.
| Lecture | Étayée ? |
|---|---|
| « Le programme ne marche pas » | Non — le protocole ne pouvait pas détecter l’effet pertinent |
| « Le programme n’a pas de grand effet sur la littératie » | Oui — au-delà de 3,5 points est écarté |
| « Le gain de 7 points n’est pas attribuable au programme » | Oui — les écoles témoins ont monté davantage |
| « Il faut réorienter le financement » | Non — cela exige une estimation d’effet que cette étude n’a pas |
| « La prochaine évaluation a besoin de 60 écoles » | Oui — calculé, et actionnable |
Les deux lignes « oui » du milieu sont de vrais constats et ce sont des constats importuns : ils retirent un chiffre phare qu’un programme employait. Le livrer est le travail, et le faire aux côtés de la recommandation de la dernière ligne est ce qui le rend recevable.
Écrire pour le lecteur qui citera une seule phrase
Quelqu’un extraira une ligne de ce rapport et la mettra sur une diapositive. Décidez maintenant laquelle.
Pas : « Aucun effet statistiquement significatif de la cantine scolaire sur la littératie n’a été trouvé. » Vrai, et cela sera lu comme « le programme ne marche pas ».
Pas : « La littératie a monté de 7 points dans les écoles du programme. » Vrai, et cela sera lu comme l’effet.
Ceci : « La littératie a monté de 7 points dans les écoles avec et sans programme ; cette évaluation n’était pas assez grande pour détecter la différence de 3 points qui intéresse le programme. »
Mettez cette phrase dans le résumé, dans la conclusion et dans le courriel d’accompagnement. La phrase citable est choisie par vous ou elle est choisie pour vous.
Ce dont ce cours a traité
Huit leçons et une idée : une affirmation d’impact est une comparaison dont une moitié est absente, et le protocole est l’argumentation sur ce qui la comble.
Chaque méthode présentée — randomisation, différences de différences, appariement, discontinuité — est une argumentation différente pour la même quantité manquante, et chacune est plus ou moins solide selon des faits concernant le déploiement du programme plutôt que selon quoi que ce soit dans l’analyse.
Ce qui signifie que les décisions les plus lourdes de conséquences ont été prises avant l’existence de la moindre donnée : qui a reçu le programme et dans quel ordre, ce qui a été mesuré et sur qui, et combien d’unités ont été affectées. Un analyste qui arrive après choisit parmi les argumentations que le déploiement a laissées disponibles.
La chose utile que ce cours demande n’est donc pas une technique. C’est d’être dans la pièce en janvier, avec une page, à demander comment les écoles seront choisies et si l’ordre peut être randomisé — une question qui ne coûte rien à poser et devient sans réponse un an plus tard.
Rapportez-le en entier
Evaluation of the school feeding programme: methods and limitations
Design Difference-in-differences, 15 programme and 9
comparison schools, baseline and endline literacy on
585 students with both rounds.
Counterfactual Comparison schools, assumed to have been on the same
trajectory. Two rounds exist, so parallel trends is
argued (numeracy shows the same null; no single school
drives the result) and not tested.
Estimate -0.96 percentage points, 95% CI -3.5 to +1.6,
clustered on 24 schools.
Power Minimum detectable effect 4.9 points at 80% power,
against a 3-point threshold of interest. Underpowered
for the relevant effect size.
Balance All six baseline characteristics imbalanced beyond 0.25
standardised. Adjusted for baseline and district;
unmeasured selection is not addressed.
Attrition 585 of 741 baseline students have an endline. Those who
left scored 39.3% at baseline against 56.8% for those
who stayed.
Not claimed Any effect on attendance, enrolment or nutrition. Any
causal effect beyond the difference-in-differences
assumption. Any conclusion about effects below 3 points.
Plan Written 2024-01-15, one deviation listed in Annex A,
three exploratory analyses in Annex B.
Huit lignes, et un relecteur peut reconstituer chaque décision à partir d’elles. C’est le livrable vers lequel ce cours a construit : non pas un nombre, mais un nombre entouré de tout ce dont un lecteur a besoin pour savoir ce qu’il est.
La suite
Le module 5 est complet : l’incertitude, puis les modèles, puis les protocoles. Le module 6 porte sur la restitution — transformer ce que vous avez établi en quelque chose qu’un programme peut voir, employer et reconstruire, c’est-à-dire la dernière chose qui sépare une analyse d’une décision.