Leçon 7 sur 8
Unité · Ce que l'évaluation affirme
Une page, écrite avant l'arrivée des données
Chaque protocole de ce cours a été reconstitué après coup, et chaque reconstitution contenait un choix que le résultat aurait pu influencer. Cette leçon écrit les choix d'abord — le protocole, le résultat, le seuil et l'analyse — sur une page qu'un programme produira réellement.
Six choix que le résultat aurait pu faire à votre place
Chaque leçon de ce cours en contenait un, et à chaque fois l’analyste a choisi après avoir vu quelque chose.
| Leçon | Le choix | Ce qu’il aurait pu être choisi pour produire |
|---|---|---|
| 1 | Avant-après, coupe transversale ou différences de différences | +6,97, +2,12 ou −0,96 point |
| 2 | Quelles covariables comptent pour l’équilibre | Un tableau d’apparence acceptable |
| 3 | Erreurs-types groupées ou naïves | Un intervalle excluant zéro |
| 4 | Apparier ou non | −0,71 ou −0,96, et quelles écoles sont dedans |
| 5 | Quelle fenêtre | Celle qui est significative |
| 6 | Quelle CCI | Un EMD sous l’effet observé |
Six choix binaires produisent soixante-quatre analyses. Aucun n’est malhonnête et chacun se défend isolément, ce qui est précisément pourquoi la défense doit être déposée avant que le résultat soit connu.
C’est le problème des comparaisons multiples du cours de statistiques sous un autre habit. Là c’étaient vingt-quatre tests ; ici c’est un test choisi parmi soixante-quatre analyses possibles, et la correction n’est pas arithmétique — c’est d’écrire le choix d’avance.
La page
Ni un protocole, ni un rapport enregistré. Une page, produite la semaine où l’évaluation est commandée, parce que l’alternative réaliste est rien du tout.
Evaluation plan: school feeding and learning outcomes
Written 2024-01-15, before any endline data exists.
1. QUESTION
Does the school feeding programme raise literacy scores?
2. DESIGN
Difference-in-differences. 15 programme schools, 9 comparison schools,
baseline and endline literacy assessment on the same children.
Assignment was not randomised; the balance table will be reported.
3. OUTCOME
Percent correct on the literacy assessment. Baseline is out of 40 items
and endline out of 50, so raw scores are not comparable and percent
correct is the primary outcome. Numeracy is secondary.
4. THRESHOLD OF INTEREST
3 percentage points. Below that the programme would not be expanded on
these grounds, so an effect smaller than 3 points is reported as
"no programme-relevant effect" regardless of its p-value.
5. ANALYSIS
OLS of the individual gain on a programme indicator, standard errors
clustered on school. Adjusted for baseline score and district.
Reported with a 95% confidence interval, not a p-value alone.
6. POWER
ICC assumed 0.065 from the attendance data. Minimum detectable effect
4.9 points, which is above the 3-point threshold. The evaluation is
therefore underpowered for the effect size that matters, and this is
stated in the report whatever the result.
7. WHAT WOULD CHANGE THE CONCLUSION
Attrition above 20%, or differential attrition between arms above 5
points, would make the panel unrepresentative and the primary analysis
would be reported alongside a bounds analysis.
8. WHAT WE WILL NOT CLAIM
Causality beyond difference-in-differences. Effects on attendance,
enrolment or nutrition, which are not measured here.
Le point 6 est ce qui rend ce document digne d’être écrit. Il est connaissable en janvier, il dit que l’étude ne peut pas répondre à la question pour laquelle elle a été commandée, et l’apprendre en janvier ne coûte rien tandis que l’apprendre en décembre coûte une année.
Pourquoi chaque section est là
La question, en une phrase. S’il en faut plus d’une, c’est plus d’une évaluation.
Le protocole, nommé. « Nous comparerons les écoles avec et sans programme » n’est pas un protocole ; ce sont trois protocoles qui donnent trois réponses.
Le résultat, défini à l’item près. L’exercice du cours de statistiques a trouvé une demande comparant une épreuve de 40 items à une de 50. Spécifier « pourcentage de réussite » en janvier est ce qui l’empêche.
Le seuil d’intérêt, en unités de programme. C’est la section que personne n’écrit et c’est celle qui empêche un rien significatif d’être rapporté comme un constat. Demandez au responsable de programme : quelle ampleur faudrait-il pour que vous étendiez le programme ?
L’analyse, spécifiée. Y compris les erreurs-types, parce que le choix entre naïves et groupées a déplacé l’intervalle dans chaque leçon du cours de régression.
La puissance, calculée. Avant, non après.
Ce qui changerait la conclusion. Nommer les modes d’échec d’avance signifie que le rapport n’aura pas à débattre de leur anticipation.
Ce que vous n’affirmerez pas. La section la plus courte et celle qui protège la crédibilité de l’évaluation quand quelqu’un d’autre la surlit.
S’écarter du plan
Les plans se trompent, les données arrivent abîmées, et la réponse n’est pas de faire comme si de rien n’était.
Les écarts sont permis et doivent être listés. Un court tableau dans le rapport — ce qui était prévu, ce qui a été fait, pourquoi — coûte quatre lignes et convertit une incohérence apparente en décision documentée.
Deviations from the evaluation plan
Planned: adjust for baseline score and district.
Done: as planned.
Planned: primary analysis on all enrolled students.
Done: restricted to the 585 students with both assessment rounds.
Why: 156 students have no endline. Attrition analysis added; the
students who left scored 39.3% at baseline against 56.8% for
those who stayed, so the panel is not representative and this
is reported as a limitation.
Un écart listé est une force. Un écart non listé, découvert par un relecteur, est la fin de la crédibilité de l’évaluation, et ce qui les sépare fait quatre lignes écrites sur le moment.
Préspécifier ne veut pas dire ne pas explorer
Deux sections, clairement étiquetées. L’analyse préspécifiée répond à la question posée. Tout le reste est exploratoire, est étiqueté exploratoire, et engendre des hypothèses pour le passage suivant plutôt que des conclusions pour celui-ci.
PRIMARY = "gain ~ feeding_programme + baseline + district" # pre-specified
EXPLORATORY = [ # labelled as such
"gain ~ feeding_programme * sex",
"gain ~ feeding_programme * baseline_quartile",
"gain ~ feeding_programme + C(school_id)",
]
print(f"pre-specified: 1 model. exploratory: {len(EXPLORATORY)} models.")
# Two objects, two headings in the report. That is the whole discipline.
Un constat de sous-groupe est exploratoire à moins que le sous-groupe ait été nommé d’avance. Le cours de statistiques a trouvé deux écoles significatives sur vingt-quatre pour un effet exactement nul ; une analyse de sous-groupe choisie après avoir vu les données est la même machine.
Quand il n’y a pas de plan et que les données sont arrivées
Ce qui est le cas courant, et il n’est pas désespéré.
Écrivez le plan quand même, daté, avant de lancer l’analyse. Vous avez vu les données ; vous n’avez pas encore vu le résultat. Cela vaut mieux que rien et il est honnête de le dire.
Préspécifiez l’analyse principale et rapportez tout le reste comme exploratoire. La distinction garde du sens même tracée tardivement.
Dites combien d’analyses vous avez lancées. Le bloc de rapport du cours de statistiques se termine par « comparaisons lancées au total », et il a sa place ici pour la même raison.
Rapportez-le en entier
Analysis plan and deviations
The evaluation plan was written on 2024-01-15, before endline data
collection, and is reproduced in Annex A.
Primary analysis as pre-specified: difference-in-differences on percent
correct, clustered on school, adjusted for baseline and district.
Deviations: one, listed in Annex A. The panel was restricted to students
with both rounds; an attrition analysis was added.
Exploratory analyses: 3, reported in Annex B and labelled as exploratory.
None is presented as a finding.
Threshold of interest: 3 percentage points, agreed with the programme team
in January. The observed estimate is -0.96 points (95% CI -3.5 to +1.6)
and is below the threshold in magnitude.
La date de la première ligne est l’élément porteur de tout le document. Tout le reste est une affirmation d’intention ; la date est ce qui la rend vérifiable.
La suite
Le plan dit ce que l’évaluation affirmera. La dernière leçon écrit le rapport qui en résulte — un rapport dont le constat central est que la question posée ne peut pas être tranchée avec les données existantes, et qui est plus utile que l’alternative.