cassionAnalyse de données

Leçon 6 sur 8

Unité · Des règles, et des limites

La réponse était fixée avant la mesure du premier enfant

Vingt-quatre écoles de cinquante enfants chacune peuvent détecter 4,9 points. Les mêmes 1 200 enfants randomisés individuellement pourraient en détecter 2,3. Le protocole a décidé de ce que l'évaluation était capable de trouver, des années avant que quiconque lise un résultat.

PythonR180 minEnquête SMARTCritères d'évaluation du CAD de l'OCDEDéfinitions d'indicateurs de l'UNICEF

Calculez ce que le protocole peut trouver

import numpy as np

SD = 0.1429        # within-school SD of attendance, from the register
ICC = 0.065        # intra-cluster correlation, from the empty mixed model
M = 50             # children per school
Z_ALPHA, Z_BETA = 1.96, 0.84       # 5% two-sided, 80% power

deff = 1 + (M - 1) * ICC
print(f"design effect {deff:.2f}")

def mde(k_treated, k_control):
    n1, n0 = k_treated * M, k_control * M
    return (Z_ALPHA + Z_BETA) * SD * np.sqrt(deff * (1 / n1 + 1 / n0))

print(f"15 vs 9 schools: {mde(15, 9) * 100:.2f} points")
# clusterPower::cpa.normal(), or the formula above. Either way, before the study.

Effet de plan 4,19. Effet minimal détectable 4,88 points.

Cette évaluation n’aurait jamais pu trouver un effet inférieur à environ cinq points de présence, quoi qu’ait fait l’analyse par la suite. C’est une propriété de 24 écoles, cinquante enfants chacune, et une corrélation intra-classe de 0,065 — les trois connues avant qu’un enfant soit mesuré.

D’où vient le nombre

Quatre entrées, et deux seulement sont des décisions.

Entrée Ici Décision ou fait ?
Écart-type du résultat 0,143 Fait, tiré d’un pilote ou d’un passage antérieur
Corrélation intra-classe 0,065 Fait, et celui que personne n’a d’ordinaire
Grappes par bras 15 et 9 Décision
Enfants par grappe 50 Décision, et le levier le plus faible
for k in (12, 24, 40, 60, 100):
    print(f"{k:3} schools: MDE {mde(k // 2, k // 2) * 100:.2f} points")
# The whole planning conversation in five rows.
Écoles Enfants EMD
12 600 6,68 pts
24 1 200 4,73 pts
40 2 000 3,66 pts
60 3 000 2,99 pts
100 5 000 2,32 pts

Diviser par deux l’effet détectable coûte environ quatre fois plus d’écoles. La précision s’améliore comme la racine carrée, si bien qu’un protocole visant 3 points au lieu de 4,7 a besoin de 60 écoles et non de 24.

Des grappes, pas des enfants

C’est le nombre qui surprend les responsables de programme et c’est toute la raison pour laquelle les protocoles en grappes coûtent cher.

individual = (Z_ALPHA + Z_BETA) * SD * np.sqrt(4 / 1200)
print(f"1,200 children, individually randomised: {individual * 100:.2f} points")
print(f"1,200 children in 24 schools:            {mde(12, 12) * 100:.2f} points")
print(f"ratio: {np.sqrt(deff):.2f}")
# Same children, same outcome, same budget. Twice the detectable effect.

2,31 points individuellement, 4,73 points en grappes — un facteur 2,05, qui est la racine carrée de l’effet de plan.

Ajouter des enfants aux écoles existantes n’aide presque pas. Avec une CCI de 0,065, passer de 50 à 100 enfants par école porte l’effet de plan de 4,19 à 7,44 et l’EMD de 4,73 à 4,45 points — 6 % d’amélioration pour le double du travail de terrain.

Ajouter des écoles aide proportionnellement. C’est la règle de planification : quand le programme est attribué par grappe, achetez des grappes.

La corrélation intra-classe est l’entrée que personne n’a

C’est la plus difficile des quatre à obtenir et celle qui déplace le plus la réponse.

for icc in (0.01, 0.03, 0.065, 0.10, 0.20):
    d = 1 + (M - 1) * icc
    m = (Z_ALPHA + Z_BETA) * SD * np.sqrt(d * (1 / 600 + 1 / 600))
    print(f"ICC {icc:.3f}: design effect {d:5.2f}, MDE {m * 100:.2f} points")
# Vary the ICC across the plausible range and report the MDE for each.
CCI Effet de plan EMD, 24 écoles
0,01 1,49 2,82 pts
0,03 2,47 3,63 pts
0,065 4,19 4,73 pts
0,10 5,90 5,61 pts
0,20 10,80 7,59 pts

L’EMD va de 2,8 à 7,6 points sur la plage plausible des CCI. Un calcul de puissance citant une seule CCI sans intervalle n’est pas un calcul, c’est une supposition assortie d’arithmétique.

Où en trouver une. Un passage antérieur de la même enquête, une étude publiée dans le même secteur et le même pays, ou un pilote. À défaut des trois, publiez le tableau ci-dessus et planifiez sur la ligne pessimiste — et dites dans le protocole quelle ligne vous avez retenue.

Ce qu’une étude sous-dimensionnée a le droit de conclure

C’est la partie qui change ce qui s’écrit, et il y a exactement trois affirmations permises.

« Aucun effet supérieur à X n’a été détecté. » Avec un EMD de 4,9 points et des différences de différences observées de −0,96 assorties d’un intervalle de −3,5 à +1,6, la phrase honnête est que les effets supérieurs à environ 3,5 points dans un sens ou l’autre sont écartés et les plus petits non.

« L’étude n’était pas conçue pour détecter un effet de l’ampleur qui compte. » Si le programme serait jugé valable à 2 points et que le protocole en détecte 4,9, c’est un constat sur l’évaluation, et il aurait dû être fait avant qu’elle tourne.

« Il faut plus d’unités, et en voici le nombre. » Le tableau ci-dessus, avec la ligne que devrait viser une évaluation future.

Trois affirmations qui ne sont pas permises. « Le programme n’a eu aucun effet » — les données ne peuvent pas l’étayer. « L’effet n’était pas statistiquement significatif, il faut donc arrêter le programme » — une décision reposant sur une absence de preuve. Et le silence sur la puissance, qui laisse le lecteur fournir lui-même les deux premières.

La puissance a posteriori n’existe pas

observed = -0.0096
se = 0.0129
print(f"observed effect {observed * 100:+.2f} points, SE {se * 100:.2f}")
# Do not compute power from the observed effect. It is a rearrangement of p.

La puissance calculée à partir de l’effet observé est une fonction monotone de votre valeur p — elle n’ajoute aucune information et crée le faux sentiment d’avoir vérifié quelque chose. Un résultat non significatif avec une « faible puissance observée » est exactement un résultat non significatif.

La quantité utile est l’intervalle de confiance, comme l’a établi le cours de statistiques, et l’EMD calculé depuis le protocole plutôt que depuis le résultat. Les deux sont disponibles ici ; la puissance a posteriori n’en fait pas partie.

Rapportez-le en entier

Statistical power, school feeding evaluation

  Design    15 treated and 9 control schools, ~50 children each.
  Inputs    outcome SD 0.143, ICC 0.065 (estimated from this study's own
            empty mixed model), 5% two-sided, 80% power.

  Design effect 4.19. Minimum detectable effect 4.88 percentage points.

  The observed difference-in-differences is -0.96 points (95% CI -3.5 to
  +1.6). Effects larger than about 3.5 points in either direction are ruled
  out; smaller effects are not, and the design could not have detected them.

  This is reported as a null result about large effects. It is not evidence
  that the programme has no effect.

  Sensitivity: across ICCs from 0.01 to 0.20 the minimum detectable effect
  ranges from 2.8 to 7.6 points. The ICC used is estimated from 24 clusters
  and is itself imprecise.

  A future evaluation targeting a 3-point effect requires about 60 schools.
  Adding children to the existing 24 does not help: doubling to 100 per
  school moves the minimum detectable effect from 4.73 to 4.45 points.

Le dernier paragraphe est celui sur lequel un programme peut agir, et c’est la raison de calculer la puissance après un résultat nul autant qu’avant une étude : il convertit « nous n’avons rien trouvé » en « voici ce que coûterait de trouver quelque chose ».

La suite

Tous les protocoles de ce cours ont été reconstitués après coup. La leçon suivante le fait dans le bon ordre — écrire le protocole, le résultat, l’analyse et le seuil d’intérêt avant l’arrivée des données, dans un document assez court pour que quelqu’un en produise réellement un.

Animer cette leçon

La leçon en diaporama, la prose étant reléguée dans les notes du présentateur plutôt que projetée. Produit à partir de cette page, dont il ne peut donc pas s'écarter.

Lancer le diaporamaLire les diapositives

Le PDF ne requiert aucun logiciel et se projette depuis n'importe quel poste. Le fichier PowerPoint est fait pour être modifié : appliquez la charte de votre organisation, retirez une section pour une séance plus courte, ou fusionnez deux leçons en atelier.