cassionAnalyse de données

Retour à la leçonLeçon 7 sur 8Ce que vous avez le droit de publier

L'intervalle, et la phrase qui l'entoure

Le même diaporama que les téléchargements, rendu sous forme de page. Lancez le diaporama pour le présenter en plein écran — les flèches ou un clic avancent d'une diapositive, Échap quitte.

Diapositives · PDFDiapositives · PowerPoint

  1. Diapositive 1 / 25

    Ce que couvre cette leçon

    • À quoi sert l'intervalle
    • L'intervalle des manuels, et où il échoue
    • L'intervalle logit
    • Les degrés de liberté dont vous disposez réellement
    • Des intervalles qui se chevauchent ne constituent pas un test
    • Arrondis et fausse précision
    • La phrase
    • Lire un intervalle face à un seuil
    • La suite
    Notes du présentateur
    Pourquoi l'intervalle des manuels donne 0,88 % pour une proportion qui ne peut pas descendre sous zéro, l'intervalle logit qui corrige cela, les 72 degrés de liberté dont vous disposez, et pourquoi deux intervalles qui se chevauchent ne signifient pas l'absence de différence.
  2. Diapositive 2 / 25

    À quoi sert l'intervalle

    • Une estimation d'enquête est une conjecture sur une population, faite à partir d'un échantillon.
    Notes du présentateur
    Une estimation d'enquête est une conjecture sur une population, faite à partir d'un échantillon. L'intervalle de confiance est la largeur honnête de cette conjecture, et publier l'estimation ponctuelle sans lui est le mésusage le plus répandu des données d'enquête dans ce secteur. La lecture formelle — « 95 % des intervalles construits ainsi contiendraient la vraie valeur » — est correcte et inutile en réunion. C'est la lecture opérationnelle qu'il vous faut : l'intervalle est l'ensemble des valeurs de population qui ne seraient pas surprenantes au vu de cet échantillon. Si un seuil se situe à l'intérieur de votre intervalle, votre enquête ne peut pas dire de quel côté se trouve la population.
  3. Diapositive 3 / 25

    L'intervalle des manuels, et où il échoue — Exemple

    p +/- z * se
  4. Diapositive 4 / 25

    L'intervalle des manuels, et où il échoue — En Python

    p, se = 0.0217, 0.0066
    print(f"Wald: {p - 1.96 * se:.2%} to {p + 1.96 * se:.2%}")
    Notes du présentateur
    Correct au milieu de la plage et faux aux extrémités. Prenez la malnutrition aiguë sévère parmi les enfants mesurés.
  5. Diapositive 5 / 25

    L'intervalle des manuels, et où il échoue — En R

    p <- 0.0217; se <- 0.0066
    c(p - 1.96 * se, p + 1.96 * se)
    Notes du présentateur
    2,17 %, intervalle 0,88 % à 3,46 %. Symétrique, et la symétrie est le problème : une proportion ne peut pas être négative, et avec une estimation légèrement plus faible cet intervalle descendrait sous zéro et serait publié quand même.
  6. Diapositive 6 / 25

    L'intervalle logit — En Python

    import math
    
    logit = math.log(p / (1 - p))
    se_logit = se / (p * (1 - p))
    low, high = (logit - 1.96 * se_logit, logit + 1.96 * se_logit)
    
    print(f"logit: {1 / (1 + math.exp(-low)):.2%} to {1 / (1 + math.exp(-high)):.2%}")
    Notes du présentateur
    Passez à l'échelle des log-cotes, construisez l'intervalle là, revenez.
  7. Diapositive 7 / 25

    L'intervalle logit — En R

    library(survey)
    svyciprop(~I(child_muac_mm < 115), child_design, method = "logit")
  8. Diapositive 8 / 25

    L'intervalle logit

    • 1,19 % à 3,92 % — Asymétrique — plus étendu au-dessus de l'estimation qu'en dessous — ce qui est la forme correcte pour…
    Notes du présentateur
    1,19 % à 3,92 %. Asymétrique — plus étendu au-dessus de l'estimation qu'en dessous — ce qui est la forme correcte pour une petite proportion, et il ne peut pas sortir de l'intervalle 0-1 quelle que soit l'estimation. Employez l'intervalle logit pour toute proportion sous 10 % environ ou au-dessus de 90 %. Au milieu, les deux concordent à la décimale près et cela n'a pas d'importance. svyciprop(..., method = "logit") sous R le fait directement ; les exemples Python de ce cours le calculent comme ci-dessus.
  9. Diapositive 9 / 25

    Les degrés de liberté dont vous disposez réellement — Exemple

    df = number of PSUs - number of strata
    Notes du présentateur
    Le 1,96 suppose une loi normale, ce qui suppose beaucoup d'observations indépendantes. Dans une enquête en grappes, les unités indépendantes sont les grappes, non les ménages.
  10. Diapositive 10 / 25

    Les degrés de liberté dont vous disposez réellement — En Python

    clusters = survey["ea_id"].nunique()
    strata = survey["stratum"].nunique()
    print(f"{clusters} clusters, {strata} strata, df = {clusters - strata}")
  11. Diapositive 11 / 25

    Les degrés de liberté dont vous disposez réellement — En R

    c(clusters = n_distinct(survey$ea_id), strata = n_distinct(survey$stratum))
    degf(design)
  12. Diapositive 12 / 25

    Les degrés de liberté dont vous disposez réellement

    • Employez le multiplicateur t, et rapportez les degrés de liberté — Cela ne coûte rien et cela dit au lecteur combien de…
    Notes du présentateur
    Soixante-quinze grappes, trois strates, 72 degrés de liberté, et t(0,975 ; 72) vaut 1,993 plutôt que 1,96. Une différence de 2 % sur la largeur de l'intervalle, ici sans importance, et c'est exactement le genre de chose qui cesse vite d'être sans importance — une enquête à douze grappes a neuf degrés de liberté et un multiplicateur de 2,26, soit 15 % de plus que l'approximation normale. Employez le multiplicateur t, et rapportez les degrés de liberté. Cela ne coûte rien et cela dit au lecteur combien de grappes vous aviez sans qu'il ait à le demander.
  13. Diapositive 13 / 25

    Des intervalles qui se chevauchent ne constituent pas un test — En Python

    for stratum in ["urban", "rural-accessible", "rural-remote"]:
        print(stratum)   # displaced households
    Notes du présentateur
    Le contresens le plus lourd de conséquences de cette leçon.
  14. Diapositive 14 / 25

    Des intervalles qui se chevauchent ne constituent pas un test

    StrateDéplacésIntervalle 95 %
    Urbain15,6 %12,0 – 19,2 %
    Rural accessible8,0 %4,7 – 11,3 %
    Rural reculé15,7 %11,0 – 20,4 %
  15. Diapositive 15 / 25

    Des intervalles qui se chevauchent ne constituent pas un test — En R

    svyttest(I(displacement_status == "displaced") ~ I(stratum == "urban"),
             subset(design, stratum != "rural-remote"))
    Notes du présentateur
    Les intervalles urbain et rural accessible ne se chevauchent pas, donc ces deux-là diffèrent. Urbain et rural reculé se chevauchent presque entièrement, donc ces deux-là ne diffèrent pas de façon détectable. Vient maintenant le piège — deux intervalles qui se chevauchent légèrement peuvent malgré tout différer significativement. Comparer des intervalles est un test plus grossier que comparer la différence, car la différence a sa propre erreur type, plus petite que la somme des deux.
  16. Diapositive 16 / 25

    Des intervalles qui se chevauchent ne constituent pas un test — En Python

    # The difference of two estimates, with its own standard error
    diff = p_urban - p_rural
    se_diff = math.sqrt(se_urban**2 + se_rural**2)
    print(f"difference {diff:.1%}, 95% CI {diff - 1.99 * se_diff:.1%} to "
          f"{diff + 1.99 * se_diff:.1%}")
    Notes du présentateur
    La règle — pour comparer deux estimations, estimez la différence et mettez un intervalle dessus. Lire deux intervalles est une étape de tri, pas une conclusion. Remarquez aussi que la ligne Python ci-dessus suppose les deux estimations indépendantes, ce qui est vrai pour des strates séparées et faux pour deux sous-groupes d'une même strate — dans ce cas le terme de covariance compte, et svyttest ou svycontrast le traite correctement.
  17. Diapositive 17 / 25

    Arrondis et fausse précision — En Python

    print(f"{p:.1%} (95% CI {low:.1%} to {high:.1%})")
    Notes du présentateur
    Un intervalle de ±3,6 points ne soutient pas trois décimales.
  18. Diapositive 18 / 25

    Arrondis et fausse précision — En R

    sprintf("%.1f%% (95%% CI %.1f-%.1f)", 100 * p, 100 * low, 100 * high)
  19. Diapositive 19 / 25

    Arrondis et fausse précision

    • Une décimale pour un pourcentage issu d'une enquête de cette taille. Deux laissent entendre une précision de 0,01…
    • Arrondissez l'intervalle vers l'extérieur, jamais vers l'intérieur. 25,47-32,71 devient 25,4-32,8.
    • N'arrondissez jamais l'estimation ponctuelle jusqu'à un seuil. Une estimation de 14,96 % rapportée « 15 % » à côté…
  20. Diapositive 20 / 25

    La phrase

    L'insécurité alimentaire des ménages est estimée à 29,1 % (IC 95 % 25,5-32,7), sur 996 ménages répartis dans 75 grappes, pondérés selon la base de sondage et ajustés pour la non-réponse ; effet de plan 1,60, échantillon effectif 623.
  21. Diapositive 21 / 25

    La phrase

    L'insécurité alimentaire touche 32,8 % des ménages.
    Notes du présentateur
    Le nombre, l'intervalle, le dénominateur, le plan. Une phrase, et c'est le livrable de tout ce cours. Comparez avec ce qui se publie d'ordinaire. La seconde phrase est non pondérée, sans intervalle, sans dénominateur et sans plan. Elle est aussi 3,7 points plus haute, et c'est elle qui sera citée.
  22. Diapositive 22 / 25

    Lire un intervalle face à un seuil — En Python

    THRESHOLD = 0.15
    
    if high < THRESHOLD:
        verdict = "below the threshold"
    elif low > THRESHOLD:
        verdict = "above the threshold"
    else:
        verdict = "cannot be distinguished from the threshold"
    print(verdict)
    Notes du présentateur
    La question que ce secteur pose le plus souvent, et celle pour laquelle l'intervalle existe.
  23. Diapositive 23 / 25

    Lire un intervalle face à un seuil — En R

    dplyr::case_when(
      high < 0.15 ~ "below the threshold",
      low  > 0.15 ~ "above the threshold",
      TRUE        ~ "cannot be distinguished from the threshold"
    )
    Notes du présentateur
    La troisième branche est celle qu'on supprime, et c'est la réponse honnête la plus fréquente. Une estimation de 14,2 % assortie d'un intervalle de 11,0-18,1 ne dit pas que la situation est sous le seuil d'urgence ; elle dit que l'enquête ne peut pas trancher. Cette phrase est mal accueillie, exacte, et considérablement moins chère qu'une réponse dimensionnée sur un chiffre incapable de porter la décision.
  24. Diapositive 24 / 25

    La suite

    • L'intervalle dit ce que votre échantillon entier permet.
    Notes du présentateur
    L'intervalle dit ce que votre échantillon entier permet. Découpez-le en districts, groupes d'âge et sexes et chaque morceau permet bien moins. La dernière leçon dit où cesser de découper, et comment l'énoncer dans un tableau.
  25. Diapositive 25 / 25

    La suite

    Lire la leçon complète, avec le code exécutable Retour à la leçon