Exercice · Intermédiaire
Neuf points sur une autre épreuve
Une demande de financement annonce un gain de 9,7 points en littératie à p < 0,001. L'épreuve initiale comptait 40 items et la finale 50, 156 des élèves les plus faibles n'ont jamais passé la seconde, et le test a traité les mêmes enfants comme deux échantillons indépendants.
Une demande de financement part cette semaine. Son résultat phare dit :
Les scores de littératie sont passés de 21,2 à 30,9 au cours de l’année scolaire, soit un gain de 9,7 points (t = 18,0, p < 0,001, n = 1 399). Le programme produit des acquis d’apprentissage mesurables.
Chaque nombre de cette phrase se reproduit à partir du fichier versionné. La conclusion ne survit pas à vingt minutes de vérification, et votre travail est de faire cette vérification avant l’envoi.
Les fichiers
learning-assessment-2024.v1.csv — évaluations de littératie et de numératie,
initiale et finale. school-enrolment-2024.v1.csv si vous voulez savoir qui est
parti.
Ce qu’il faut trouver
Trois problèmes distincts, dans l’ordre où ils changent la réponse.
Un : le dénominateur a bougé. Regardez la colonne items par passage avant de
regarder quoi que ce soit d’autre. Recalculez la comparaison en pourcentage de
réussite et dites quelle part des 9,7 points relevait d’un changement d’épreuve
plutôt que d’un changement chez les enfants.
Deux : l’échantillon a changé. Comptez les élèves ayant une évaluation initiale et pas de finale, et comparez leur moyenne initiale à celle des élèves restés. Produisez ensuite deux versions du gain — sur tous les élèves ayant passé chaque épreuve, et sur ceux ayant passé les deux — et dites quelle part de l’écart entre ces deux nombres est de l’apprentissage et quelle part est la composition de la salle.
Trois : le test n’était pas le bon. Le t de 18,0 de la demande traite l’initiale et la finale comme deux échantillons indépendants d’enfants. Ce sont deux fois les mêmes enfants. Lancez le test apparié, rapportez les deux erreurs-types, et expliquez dans quel sens l’erreur a joué.
Ce qu’il faut rendre
Un script Python et un court bloc de prose.
Le script imprime un tableau : pour chaque version de l’analyse — scores bruts non appariés, pourcentage de réussite non apparié, pourcentage de réussite apparié — l’estimation, son intervalle de confiance à 95 %, le test employé, sa statistique et son n. Six lignes au plus.
La prose est le paragraphe de remplacement pour la demande, écrit selon la forme en quatre phrases de la leçon 8 : le nombre et son intervalle, la comparaison et son test, l’ampleur dans une unité sur laquelle un lecteur peut agir, et ce que l’analyse ne peut pas dire. Portez l’attrition comme une limite énoncée et non comme une note de bas de page.
Vérifiez-vous
| Attendu | |
|---|---|
| Items par épreuve, initiale et finale | 40 et 50 |
| Pourcentage de réussite, initiale et finale | environ 53,1 % et 61,8 % |
| Élèves avec initiale et sans finale | 156 |
| Leur moyenne initiale, contre celle des élèves restés | environ 39,3 % contre 56,8 % |
| Gain apparié, en pourcentage de réussite | environ +7,0 points, IC à 95 % 6,1 à 7,9 |
| n apparié | 585 |
| Corrélation entre les deux scores d’un enfant | environ 0,84 |
| Rapport de l’erreur-type non appariée à l’appariée | environ 2,5 |
Si votre n apparié vaut 741, vous avez gardé des élèves dont la finale manque et pandas a discrètement comblé par une moyenne. Si le gain ressort autour de 9,7 points, les scores sont encore bruts et le dénominateur bouge encore.
Trois questions
Deux phrases chacune.
1. La correction des scores bruts vers le pourcentage de réussite change le résultat phare. Dites de combien, et dites si le gain restant vaut encore d’être mis dans une demande.
2. Les élèves n’ayant pas passé la finale avaient des scores bien inférieurs à ceux qui l’ont passée. Énoncez ce que cela fait à la moyenne finale, et quel est le résultat phare honnête pour un programme qui a perdu ses élèves les plus faibles.
3. Ignorer l’appariement a rendu l’erreur-type 2,5 fois trop grande, ce qui est l’inverse de l’erreur de cantine scolaire de la leçon 6. Expliquez en langage clair pourquoi une erreur gonfle une erreur-type et l’autre la dégonfle.
L’essentiel
Un p inférieur à 0,001 a survécu aux trois défauts. Le test n’a jamais été ce qui clochait — c’est la comparaison, et aucune dose de significativité ne rattrape une comparaison entre deux épreuves différentes passées par deux groupes d’enfants différents.
Le gain qui survit est réel : environ sept points de pourcentage de réussite chez les élèves ayant passé les deux épreuves, avec un intervalle qui n’approche jamais zéro. C’est un nombre plus petit et défendable à la place d’un nombre plus grand et indéfendable, et c’est la version qui sera encore vraie quand quelqu’un vérifiera après que l’argent aura été dépensé.