@eau-pression
La difficulté n’est pas technique, mais métier, pour la pertinence du choix de la clé (ou des clés).
Sans trop connaître le sujet, je dirais qu’il faut détecter les doublons selon une clé : nom/prénom + date naissance + code_lieu_naissance [+ date_deces + lieu_deces]. Si l’on ne prend que les 3 premiers champs, que risque-t-on de louper ? Des personnes de nom, prénom, date et lieu de naissance identiques, mais qui seraient décédées à des dates ou des lieux différents ? Quel cas réel vs quel cas d’absurdité administrative cela recouvre-t-il ? Des jumeaux homonymes ?
Par ailleurs, les erreurs sur les numéros d’actes mal retranscris, comptés comme des enregistrements différents alors qu’ils sont manifestement identiques (je suis sur ce point en désaccord avec Pemile), peut par exemple se produire pour le champ nom/prénom.
Peut-être faut-il donc passer plusieurs filtres correspondant à plusieurs clés combinant différemment les éléments fournis par l’INSEE.
Lesquels ont un sens ? Lesquels sont sans intérêt ?
Là s’arrête la science informatique pour laquelle l’expression de ces conditions, quelles qu’elles soient, n’est ni très différente ni très difficile à implémenter. Et là commence le « métier ». Que je n’ai pas. Raison pour laquelle je ne pourrai jamais affirmer avoir viré tous les doublons, si d’aventure la passion des fréquences statistiques me prenait.
C’est formellement gênant. Mais les ordres de grandeur de l’erreur relative pour 2019 et 2020 sont plutôt raisonnables (0,025% environ) : est-ce rédhibitoire pour analyser les données ?
PS : Je ne sais pas ce que vous avez avec cet Alcyon. Il a certes un peu cassé les pieds à Maître Huysmans lorsque ce dernier commit l’un de ses premiers articles à propos de l’INSEE, mais l’honneur fut lavé lorsque l’auteur somme toute un peu soupe-au-lait le vira de son antre. S’il vous obsède, vous pouvez le lire sur agoravox.tv, parfois.