Formation · Débutant · Fondamentaux
R et le tidyverse pour les données de programme
Le même terrain que le cours Python, mais en R — projets et renv, readr et haven, les verbes dplyr, forcats et tidyr — enseigné sur des exports d'enquêtes et de registres, en nommant les réglages par défaut qui diffèrent de pandas plutôt qu'en les passant sous silence.
Ce que vous saurez faire
- Mettre en place un projet R qui se rouvre un an plus tard sur une autre machine, versions de paquets consignées et aucun chemin absolu dans le code
- Lire des exports CSV, Excel, Stata et SPSS sans perdre un zéro initial, une date ou une étiquette de valeur, et dire ce que chaque lecteur fait d'un code de valeur manquante
- Employer les verbes dplyr délibérément, et expliquer ce que group_by() et summarise() font des clés manquantes, des niveaux inutilisés et du regroupement qui survit à l'appel
- Ordonner les catégories avec forcats pour qu'un tableau et un graphique se lisent comme le rapport l'exige plutôt qu'alphabétiquement
- Restructurer un groupe répété aplati avec pivot_longer(), et envelopper tout le nettoyage dans une fonction qui s'applique telle quelle à l'export du trimestre suivant
Normes et méthodologies
Ceci est un cours de R, non un cours d’analyse. Il suppose que vous savez déjà ce qu’est un indicateur et pourquoi un dénominateur compte — c’est ce qu’enseigne Fondamentaux de l’analyse de données — et consacre son temps au langage : ce que font réellement les verbes du tidyverse, lesquels des réglages par défaut de R vous surprendront, et comment écrire quelque chose qui s’exécute encore quand vous n’êtes plus là.
R uniquement. Son pendant, Python pour les données de programme, couvre le même terrain en Python. Ailleurs sur cette plateforme, chaque technique est montrée dans les deux langages ; ici la séparation est le principe, car une équipe hérite le plus souvent d’une base de code plutôt qu’elle ne choisit entre deux.
Si vous avez lu le cours Python, ce que celui-ci apporte de plus utile est de
nommer les endroits où le comportement par défaut de R est l’inverse de celui
de pandas. Une valeur manquante fait renvoyer NA à mean() au lieu d’être
ignorée. Une clé de groupe manquante devient son propre groupe au lieu de
disparaître. Un niveau de facteur inutilisé subsiste au lieu d’être écarté.
Aucun de ces choix n’est meilleur ou pire ; chacun est un pari différent sur ce
que le silence doit signifier, et savoir dans quel pari on se trouve constitue
l’essentiel du métier.
Tout s’exécute sur de vrais jeux de données de la plateforme — le registre de dépistage par PB de douze communes de l’Artibonite, un extrait de vaccination au format DHIS2, une enquête ménages EAH — avec les zéros initiaux, les codes sentinelles et les codages incohérents que ces fichiers portent réellement.
Mise en pratique
Lire les leçons ne remplace pas la pratique. Chacun de ces travaux applique la formation à un jeu de données sur lequel elle n'a pas été enseignée.
- Atelier · 90 minTrois départements, six orthographesUne enquête EAH où une équipe d'enquêteurs a écrit un nom de département de quatre façons, fragmentant le département le moins bien desservi. Normalisez avec forcats, placez chaque ménage sur les échelles du JMP, puis enveloppez le tout dans une fonction qui tournera sur la prochaine vague.
- Exercice · 40 minLe regroupement qui traîneQuatre chaînes dplyr, chacune renvoyant un chiffre plausible qui répond à une autre question que celle posée. Trouvez le regroupement résiduel, dites ce que chacune calcule réellement, et réécrivez-la.
Progression
Emporter hors ligne
L'intégralité de la formation en PDF composé — chaque leçon, chaque exemple de code, le dictionnaire des variables et les définitions d'indicateurs. Produit à partir de la même source que cette page.
La source LaTeX accompagne chaque PDF, afin qu'une organisation puisse adapter le support à sa charte ou intégrer une leçon à son propre kit de formation.