Formation · Avancé · Statistiques et modélisation
Régression appliquée aux données de programme
Modèles linéaires, logistiques et multiniveaux ajustés sur des données d'enquête et de routine, avec une interprétation rédigée pour un responsable de programme non statisticien.
Ce que vous saurez faire
- Lire un coefficient de régression comme la comparaison de moyennes qu'il est, et dire laquelle
- Distinguer l'ajustement, qui déplace l'estimation, du regroupement en grappes, qui déplace l'erreur-type
- Ajuster un modèle logistique et le rapporter en différence de risques plutôt qu'en rapport de cotes que le lecteur interprétera de travers
- Décider quelles covariables ont leur place dans un modèle et lesquelles en détruisent la réponse par leur seule présence
- Ajuster une constante aléatoire quand le protocole a attribué au-dessus du niveau de la ligne
- Pondérer un modèle selon son plan de sondage, et rendre compte d'un modèle qui s'ajuste mal plutôt que de l'écarter
Normes et méthodologies
Une régression n’est pas un instrument plus sophistiqué que les comparaisons de Statistiques appliquées aux programmes. C’est la même comparaison avec plus d’une chose maintenue fixe, et la première leçon le démontre : ajustez un modèle à une seule variable indicatrice et le coefficient est l’écart entre deux moyennes de groupe, à la décimale près.
C’est l’ossature du cours. Un coefficient est toujours une comparaison, et le travail consiste à dire laquelle.
Trois résultats le structurent, tous ajustés sur des fichiers déjà commités.
L’ajustement et le regroupement en grappes sont deux problèmes distincts aux remèdes distincts. L’effet de la cantine vaut 4,9 points avec une erreur-type de 0,9 en ajustement naïf. Ajouter toutes les covariables individuelles du registre déplace l’estimation à 4,4 et laisse l’erreur-type tranquille. Ajouter un terme pour l’école laisse l’estimation tranquille et porte l’erreur-type à 1,5. Confondre les deux est l’erreur la plus courante d’une régression de programme, et c’est pourquoi elles sont enseignées dans le même cours.
Un rapport de cotes de 0,43 décrit un rapport de risques de 0,58. Les cas signalant un handicap aboutissent à 26,4 % contre 45,5 %. Le rapport de cotes est ce qu’imprime un modèle logistique et la différence de risques est ce que le lecteur croit qu’on lui dit, et l’écart entre les deux se creuse précisément quand le résultat est fréquent — ce qui, dans des données de programme, est le cas habituel.
Ajuster sur la mauvaise covariable retire 42 % de l’effet. L’aboutissement d’une orientation passe par une porte — le fait qu’une orientation ait été émise — et les cas signalant un handicap franchissent cette porte à 53,8 % contre 71,5 %. Mettez la porte dans le modèle et l’écart selon le handicap tombe de 19,4 points à 11,2, non parce que l’estimation s’est améliorée mais parce que le modèle s’est mis à répondre à une autre question.
Python et R tout du long. Il vous faut Statistiques appliquées aux programmes d’abord ; ce cours suppose que vous savez déjà poser un intervalle sur un nombre et dire ce qu’une valeur p ne vous apprend pas.
Mise en pratique
Lire les leçons ne remplace pas la pratique. Chacun de ces travaux applique la formation à un jeu de données sur lequel elle n'a pas été enseignée.
- Atelier · 180 minQuatre décisions, un coefficientUn modèle de gestion sur 2 625 visites de points d'eau affirme que la gestion par ONG, les sources de captage, l'âge du point et un district comptent tous. Le registre contient 242 points visités douze fois chacun. Corrigez cela et quatre de ces constats cessent d'en être, et les coefficients ne bougent jamais.
- Exercice · 60 minLes deux programmes qui ne se sont jamais rencontrésUne note affirme que le TSFP guérit mieux que l'OTP — 75,3 % contre 72,6 %. Ajustez sur le PB à l'admission et rien ne change. Regardez ensuite où les deux programmes se recouvrent, et trouvez 106 enfants sans aucun comparateur.
Progression
Emporter hors ligne
L'intégralité de la formation en PDF composé — chaque leçon, chaque exemple de code, le dictionnaire des variables et les définitions d'indicateurs. Produit à partir de la même source que cette page.
La source LaTeX accompagne chaque PDF, afin qu'une organisation puisse adapter le support à sa charte ou intégrer une leçon à son propre kit de formation.