Tag Archives: Big Data

07mars/18

Démographie historique et données collaboratives

Généalogie de Victor Hugo

Il y a quelques mois, j’indiquais dans un billet du blog que j’avais présenté les débuts des travaux engagés avec Arthur Charpentier au sujet de la démographie historique à partir de données collaboratives issues du site geneanet.org. J’avais également fait part de l’avancée des recherches lors d’une matinée d’exposés avec les membres de la chaire Actinfo (c.f. billet). Aujourd’hui, Arthur et moi avons déposé un document de travail intitulé « Étude de la démographie française du XIXe siècle à partir de données collaboratives de généalogie » sur HAL.

Dans ce papier, nous explorons un jeu de données de 2,45 millions d’individus, correspondant à des personnes nées entre 1800 et 1804 en France ainsi qu’à leurs descendants sur 3 générations. Les données brutes étaient gigantesques : plus de 700 000 000 de lignes. Chaque ligne représente un événement (naissance, mariage ou décès) pour un individu dans l’arbre d’un utilisateur de geneanet.org. Or, comme chaque utilisateur créé son propre arbre (il faut noter que nous n’avons pas accès aux arbres des utilisateurs n’ayant pas souhaité le rendre public), les individus se retrouvent dupliqués dans la base. Un gros travail d’appariement et de nettoyage des arbres a donc été réalisé et a conduit à ce nombre de 2,45 millions d’individus.

18janv./17

Is Big Data Good or Evil?

Flyer Eco clubHier, avec Arthur Charpentier (@freakonometrics), nous avons rejoint le club d’éco à l’institut franco-américain (@IFArennes). Nous avions été invité par Alice Bernard pour parler avec les membres du club du Big Data. Les discussions avec les membres étaient enrichissantes !

Les slides projetées pendant la présentation sont disponibles à l’intérieur du billet.