cassionAnalyse de données

Leçon 8 sur 8

Unité · Jugement

Ce qu'un évaluateur fait de vos chiffres

Six critères du CAD de l'OCDE, la question que chacun pose à votre jeu d'indicateurs, et les lacunes qui ne se comblent qu'avant l'évaluation et non pendant.

PythonR75 minCritères d'évaluation du CAD de l'OCDEGestion axée sur les résultats (GAR)Cadre logique

La revue est le test pour lequel vos indicateurs ont été bâtis

À un moment, quelqu’un d’extérieur — une revue à mi-parcours, une évaluation finale, un conseiller suivi du bailleur — prend votre cadre logique, vos fiches de référence et vos chiffres rapportés, et demande s’ils soutiennent ce que le programme affirme.

L’essentiel de la réponse s’est décidé dix-huit mois plus tôt, dans des choix que ce cours a déjà couverts. Cette leçon est la liste de contrôle lue à l’envers — ce qui sera demandé, et ce qu’il faut avoir déjà fait.

Les six critères, et la question que chacun pose à vos données

Les critères du CAD de l’OCDE sont le vocabulaire de presque toute évaluation de ce secteur.

Critère La question Ce qu’il exige de vous
Pertinence Était-ce la bonne chose à faire ? Des données d’évaluation des besoins, et des indicateurs mesurant le besoin et non la seule activité
Cohérence Cela s’articulait-il au reste ? Des définitions comparables — la leçon sur les normes, encaissée
Efficacité Les objectifs ont-ils été atteints ? Référence, cible, et un indicateur d’effet qui ne soit pas un produit
Efficience L’usage des ressources était-il raisonnable ? Portée ou volume avec un dénominateur, et des données de coût jointes
Impact Quelle différence cela a-t-il faite au total ? Un contrefactuel, ou l’énoncé honnête que vous n’en avez pas
Durabilité Les bénéfices dureront-ils ? Une mesure après passation, que presque personne n’a

Parcourez la colonne de droite et vous prédirez les critères sur lesquels votre programme sera mal noté, avant toute visite.

Efficacité — là où la fiche de référence se rembourse

C’est le critère auquel les évaluations consacrent le plus de temps, et il se traite presque entièrement à partir des artefacts de l’unité 2.

Un évaluateur demandera, dans cet ordre :

  1. Quelle était la cible, et d’où venait-elle ? Les quatre méthodes de la leçon précédente. « Négociée » est une réponse acceptable ; une case vide non.
  2. Quelle était la référence, mesurée comment, et quand ? Même indicateur, même méthode, avant.
  3. La valeur rapportée est-elle calculée comme la référence ? Versionnez la fiche ou vous ne pourrez pas répondre.
  4. Qu’est-ce qui pourrait expliquer le changement ? Les alternatives listées en répondant à la deuxième question de la leçon 2.
evidence = pd.DataFrame({
    "indicator": ["penta3_coverage_percent_monthly"],
    "baseline": [61.4],
    "baseline_period": ["2023 mean"],
    "target": [85.0],
    "target_basis": ["negotiated, assumed full outreach budget"],
    "latest": [72.8],
    "sheet_version": ["2.1"],
    "same_method": [True],
    "confounders": ["reporting completeness rose from 71% to 77% over the period"],
})
evidence <- tibble::tribble(
  ~indicator,                        ~baseline, ~target, ~latest, ~sheet_version, ~same_method,
  "penta3_coverage_percent_monthly",      61.4,    85.0,    72.8,          "2.1",         TRUE
)

Le champ confounders est celui qui transforme une conversation défensive en conversation professionnelle. Un taux de complétude passant de 71 % à 77 % fait monter la couverture mesurée sans qu’un seul enfant supplémentaire soit vacciné. Le dire vous-même, en premier, vaut plus que n’importe quel nombre de la ligne.

Impact — dites ce que vous ne pouvez pas affirmer

Le critère d’impact demande quelle différence le programme a faite, ce qui est une question contrefactuelle. Les données de suivi de routine ne peuvent pas y répondre, et prétendre le contraire est le moyen le plus rapide de perdre la confiance d’un évaluateur sur tout le reste.

Ce que vous pouvez honnêtement offrir.

  • Une évolution avant-après, étiquetée comme telle, avec les explications alternatives nommées.
  • Une comparaison avec une zone hors programme, assortie d’un énoncé explicite des raisons de leur comparabilité ou non.
  • Une cohérence avec la théorie du changement — les étapes intermédiaires ont bougé dans l’ordre prévu, ce qui est un indice et non une preuve.

Ce que vous ne pouvez pas offrir sans un protocole qui le permette, c’est l’attribution. Méthodes d’évaluation d’impact, plus loin dans le programme, porte entièrement sur les protocoles qui le permettent — randomisation, différences de différences, appariement, régression sur discontinuité — et la position honnête d’ici là est celle énoncée franchement.

L’efficience exige un dénominateur que vous n’avez sans doute pas

Les questions d’efficience sont d’ordinaire un coût par unité de résultat, et elles échouent sur la jointure plutôt que sur l’arithmétique — les données financières sont par ligne budgétaire et par mois, les données de programme par activité et par formation, et rien ne les relie.

Si l’efficience doit être évaluée, décidez l’unité dès la conception et faites partager une clé aux deux systèmes. La rétro-adapter au moment de l’évaluation produit un nombre auquel personne ne croit, y compris celui qui l’a calculé.

Les quatre lacunes qui ne se comblent qu’en amont

Le jour où l’évaluateur arrive, elles sont figées. Chacune est bon marché dix-huit mois plus tôt et impossible le jour même.

  • Pas de référence sur la même définition. Se règle en versionnant la fiche dès le départ.
  • Aucune donnée sur les hypothèses. Se règle en donnant aux deux ou trois hypothèses critiques leurs propres indicateurs.
  • Aucun indicateur d’effet, seulement des produits. Se règle à la conception du cadre logique, et la leçon 1 apprend à le repérer.
  • Aucune mesure après passation. Se règle en budgétant un passage de suivi, ce que presque aucune proposition ne fait et dont toute section durabilité a besoin.

Constituez le dossier de preuves au fil de l’eau

L’artefact qui rend une revue simple est un dossier, tenu en continu, et non assemblé dans les quinze jours précédant la visite.

evidence/
  indicators/                reference sheets, versioned
  baseline/                  values, method notes, extract date
  targets/                   values, basis, revision history
  series/                    every period, every indicator, one row each
  dqa/                       assessment rounds and follow-ups
  assumptions/               stock-outs, access days, vacancy rates
  limitations.md             what the data cannot support

Six de ces sept sortent d’un travail que ce module exigeait déjà. Les fiches de référence sont l’unité 2, les passages d’évaluation viennent du cours précédent, la série est la table d’analyse du cours sur les jointures. Le dossier de preuves est surtout une convention de nommage posée sur des choses que vous avez déjà.

Le résumé d’une page que veut réellement un évaluateur

summary = (
    evidence[["indicator", "baseline", "target", "latest", "same_method"]]
    .assign(progress=lambda d: (d["latest"] - d["baseline"])
                               / (d["target"] - d["baseline"]))
)
print(summary.round(2))
evidence |>
  mutate(progress = (latest - baseline) / (target - baseline)) |>
  select(indicator, baseline, target, latest, progress, same_method)

L’avancement par rapport à la trajectoire, par indicateur, avec un indicateur disant si la méthode est restée constante. Tout ce qui est plus élaboré sera de toute façon reconstruit par l’évaluateur ; tout ce qui est moindre sera reconstruit par l’évaluateur à partir de vos fichiers bruts, avec ses hypothèses et non les vôtres.

Une évaluation n’est pas un examen de votre programme. C’est un examen de la question de savoir si vos preuves soutiennent ce que votre programme a affirmé. Les deux se dissocient plus souvent qu’on ne le croit, et la fiche de référence est l’endroit où on les tient ensemble.

Ce que ce cours vous laisse

Vous savez suivre un indicateur depuis le changement qu’il doit attester jusqu’à l’arithmétique, rédiger une fiche de référence à partir de laquelle un inconnu calcule, défendre un dénominateur, distinguer portée et couverture, adopter une définition normalisée et documenter votre écart, fixer une référence et une cible qui résistent à l’examen, et assembler les preuves qu’une revue demandera.

La suite du module 3 prend au sérieux deux problèmes de mesure précis. Analyse d’enquêtes, échantillonnage et pondération vient ensuite et est le cours le plus lourd du programme à ce jour — pondérations, strates, effet de plan et intervalles de confiance, ce qui transforme une estimation en estimation assortie d’une marge. Après lui, Données de routine et DHIS2 revient aux systèmes agrégés auxquels ce cours n’a cessé d’emprunter, et répond à la question qui suit toujours un taux de couverture — qu’a-t-on exactement compté ?

Animer cette leçon

La leçon en diaporama, la prose étant reléguée dans les notes du présentateur plutôt que projetée. Produit à partir de cette page, dont il ne peut donc pas s'écarter.

Lancer le diaporamaLire les diapositives

Le PDF ne requiert aucun logiciel et se projette depuis n'importe quel poste. Le fichier PowerPoint est fait pour être modifié : appliquez la charte de votre organisation, retirez une section pour une séance plus courte, ou fusionnez deux leçons en atelier.