cassionAnalyse de données

Formation · Débutant · Fondamentaux

R et le tidyverse pour les données de programme

Le même terrain que le cours Python, mais en R — projets et renv, readr et haven, les verbes dplyr, forcats et tidyr — enseigné sur des exports d'enquêtes et de registres, en nommant les réglages par défaut qui diffèrent de pandas plutôt qu'en les passant sous silence.

R20 h8 leçons

Ce que vous saurez faire

  • Mettre en place un projet R qui se rouvre un an plus tard sur une autre machine, versions de paquets consignées et aucun chemin absolu dans le code
  • Lire des exports CSV, Excel, Stata et SPSS sans perdre un zéro initial, une date ou une étiquette de valeur, et dire ce que chaque lecteur fait d'un code de valeur manquante
  • Employer les verbes dplyr délibérément, et expliquer ce que group_by() et summarise() font des clés manquantes, des niveaux inutilisés et du regroupement qui survit à l'appel
  • Ordonner les catégories avec forcats pour qu'un tableau et un graphique se lisent comme le rapport l'exige plutôt qu'alphabétiquement
  • Restructurer un groupe répété aplati avec pivot_longer(), et envelopper tout le nettoyage dans une fonction qui s'applique telle quelle à l'export du trimestre suivant

Normes et méthodologies

Gestion axée sur les résultats (GAR)Normes OMS de croissance de l'enfant

Ceci est un cours de R, non un cours d’analyse. Il suppose que vous savez déjà ce qu’est un indicateur et pourquoi un dénominateur compte — c’est ce qu’enseigne Fondamentaux de l’analyse de données — et consacre son temps au langage : ce que font réellement les verbes du tidyverse, lesquels des réglages par défaut de R vous surprendront, et comment écrire quelque chose qui s’exécute encore quand vous n’êtes plus là.

R uniquement. Son pendant, Python pour les données de programme, couvre le même terrain en Python. Ailleurs sur cette plateforme, chaque technique est montrée dans les deux langages ; ici la séparation est le principe, car une équipe hérite le plus souvent d’une base de code plutôt qu’elle ne choisit entre deux.

Si vous avez lu le cours Python, ce que celui-ci apporte de plus utile est de nommer les endroits où le comportement par défaut de R est l’inverse de celui de pandas. Une valeur manquante fait renvoyer NA à mean() au lieu d’être ignorée. Une clé de groupe manquante devient son propre groupe au lieu de disparaître. Un niveau de facteur inutilisé subsiste au lieu d’être écarté. Aucun de ces choix n’est meilleur ou pire ; chacun est un pari différent sur ce que le silence doit signifier, et savoir dans quel pari on se trouve constitue l’essentiel du métier.

Tout s’exécute sur de vrais jeux de données de la plateforme — le registre de dépistage par PB de douze communes de l’Artibonite, un extrait de vaccination au format DHIS2, une enquête ménages EAH — avec les zéros initiaux, les codes sentinelles et les codages incohérents que ces fichiers portent réellement.

Commencer la formation — Une analyse qui se rouvre un an plus tard

Mise en pratique

Lire les leçons ne remplace pas la pratique. Chacun de ces travaux applique la formation à un jeu de données sur lequel elle n'a pas été enseignée.

Progression

L'inscription est gratuite et sert uniquement à enregistrer votre progression : la formation est consultable sans compte.

Emporter hors ligne

L'intégralité de la formation en PDF composé — chaque leçon, chaque exemple de code, le dictionnaire des variables et les définitions d'indicateurs. Produit à partir de la même source que cette page.

La source LaTeX accompagne chaque PDF, afin qu'une organisation puisse adapter le support à sa charte ou intégrer une leçon à son propre kit de formation.