cassionAnalyse de données

Exercice · Intermédiaire

La pondération qui n'a jamais été appliquée

Le script d'analyse d'un collègue produit quatre estimations à partir de l'enquête ménage. Chacune est calculée correctement et chacune est fausse, de quatre façons différentes. Trouvez-les, corrigez-les, et chiffrez ce qu'elles ont coûté.

R60 min

Le script ci-dessous a été écrit par un collègue sous la pression d’une échéance et ses quatre nombres figurent déjà dans un projet de rapport. Rien n’échoue, chaque chiffre est un pourcentage plausible, et les quatre sont faux.

Votre travail est de déterminer de combien, pour chacun.

Les fichiers

household-survey-2025.v1.csv — 996 entretiens de ménage. household-survey-frame-2025.v1.csv — la base de sondage de 470 zones dont l’échantillon est tiré, avec le relevé de sélection et de réponse des 75 zones retenues.

Le script

library(dplyr)
library(readr)
library(survey)

survey <- read_csv("household-survey-2025.v1.csv")
frame  <- read_csv("household-survey-frame-2025.v1.csv")

# 1. Headline food insecurity
survey |> summarise(food_insecure = mean(food_insecure == "true"))

# 2. Improved water access, with a confidence interval
design <- svydesign(ids = ~household_id, weights = NULL, data = survey)
svymean(~I(improved_water_source == "true"), design)

# 3. Acute malnutrition among children under five
survey |>
  filter(!is.na(child_muac_mm)) |>
  summarise(gam = mean(child_muac_mm < 125))

# 4. Food insecurity among displaced households in rural remote areas
survey |>
  filter(stratum == "rural-remote", displacement_status == "displaced") |>
  summarise(n = n(), rate = mean(food_insecure == "true"))

La tâche

Pour chacune des quatre estimations :

  1. Dites ce qui ne va pas, en une phrase, en nommant le concept plutôt que la ligne de code.
  2. Recalculez correctement, en montrant le code.
  3. Chiffrez le coût, comme l’écart entre le chiffre faux et le bon, en points de pourcentage ou en largeur d’intervalle.

Produisez un tableau de quatre lignes avec ces trois colonnes et une quatrième nommant la leçon du cours dont relève le défaut.

Ce qu’exige chacune

Les défauts sont différents et aucun n’est une faute de frappe.

  • L’estimation 1 ignore quelque chose que fournit la base de sondage.
  • L’estimation 2 construit un objet de plan décrivant une enquête que personne n’a menée. Deux arguments sont faux et ils échouent en sens inverse — l’un déplace l’estimation ponctuelle, l’autre l’intervalle.
  • L’estimation 3 emploie un dénominateur qui n’est pas la population qu’elle revendique, et exige une multiplication que le script ne fait jamais. Elle hérite aussi d’un problème de qualité décrit par les défauts connus du jeu de données.
  • L’estimation 4 est la subtile. Elle est arithmétiquement correcte et ne devrait pas être publiée du tout ; dites pourquoi, avec des nombres.

Deux contrôles à votre disposition

Les pondérations reconstituées doivent totaliser 56 428, les ménages que contient la base. Si les vôtres ne le font pas, corrigez cela avant tout autre calcul.

Correctement estimées, l’insécurité alimentaire vaut 29,1 % et l’accès à une source améliorée 69,8 %.

Les questions à traiter en prose

Trois phrases chacune.

1. L’objet de plan de l’estimation 2 se trompe à la fois sur les pondérations et sur les grappes. Dites lequel des deux déplace l’estimation ponctuelle et lequel déplace l’intervalle, et laquelle des deux erreurs serait la plus difficile à repérer pour un relecteur.

2. L’estimation 3 est une proportion calculée sur les enfants mesurés. Nommez les deux corrections distinctes qu’elle exige, et dites dans quel sens chacune déplace le chiffre.

3. L’estimation 4 sera citée dans le rapport comme un constat sur les ménages déplacés des zones reculées. Donnez le nombre de ménages et le nombre de grappes qui la sous-tendent, et rédigez la phrase que vous mettriez dans le tableau à la place.

Ce qu’il faut rendre

Un script R produisant le tableau des quatre défauts et un second tableau avec les estimations corrigées, chacune portant son dénominateur, son effet de plan et son intervalle de confiance à 95 %. Les deux affichés et écrits dans outputs/.

Comment savoir que c’est fini

Chaque estimation corrigée sort d’un objet svydesign où ids, strata et weights sont tous renseignés, et vos pondérations totalisent le total de la base. L’une de vos quatre lignes corrigées est une suppression et non un nombre, et elle en dit le motif.