À propos des données : sources, méthode et limites (France)
Chaque liste de ce site est calculée à partir de registres publics, et non d'autres sites. Cette page dit lesquels, comment ils sont utilisés et où ils s'arrêtent.
Sources
| Données | Éditeur | Années | Licence | Récupéré le |
|---|---|---|---|---|
| Fichier des prénoms, édition 2025 | Insee | 1900-2025 | Licence Ouverte 2.0 (Etalab) | 2026-09-20 |
| Fichier des noms de famille, édition 2008 | Insee | 1891-2000 | Licence Ouverte 2.0 (Etalab) | 2026-09-20 |
Les licences sont indiquées telles que déclarées par l'éditeur. Vérifiez les pages des éditeurs ci-dessus avant de réutiliser les fichiers bruts.
Comment un nom est tiré
- Les prénoms viennent du fichier des prénoms de l'Insee, qui recense les prénoms donnés aux enfants nés en France de 1900 à 2025. Le fichier compte 52 340 couples prénom et sexe pour 87 644 320 naissances. Un prénom est tiré avec une probabilité proportionnelle à son nombre de naissances sur la période de la page.
- Un nom de famille est tiré indépendamment dans le fichier des noms de famille de l'Insee, proportionnellement au nombre de personnes nées entre 1891 et 2000 qui le portent. Prénom et nom n'influent pas l'un sur l'autre, l'outil ignore donc que certaines associations sont plus fréquentes que d'autres.
- Le curseur Réalisme élève chaque poids à une puissance. À 1, le tirage suit les fréquences réelles, à 0 chaque prénom est également probable.
- Tous les tirages partent d'une seule graine. La même graine, les mêmes options et la même page donnent toujours la même liste, c'est pourquoi le lien sous le générateur reproduit exactement une liste.
Ce que couvre chaque liste
- Les listes de prénoms gardent les prénoms les plus donnés jusqu'à couvrir 95 % des naissances de chaque sexe (85 % au plus bas si le fichier devenait trop lourd). Les prénoms plus rares sont laissés de côté pour que le téléchargement de chaque page reste léger.
- La liste des noms de famille garde les 13 179 plus fréquents sur 218 982. Cela représente 59 % des personnes de la table, qui couvre elle-même 92,5 % des personnes du fichier. Atteindre 95 % demanderait un fichier bien plus lourd que ce que nous autorisons.
Ce que les données ne disent pas
- Le fichier des prénoms ne contient que les prénoms donnés au moins 3 fois depuis 1900, et les effectifs annuels sont arrondis au multiple de 5 le plus proche par l'Insee. Les prénoms très rares sont donc absents ou approximatifs.
- Le fichier des noms de famille est l'édition 2008 et couvre les naissances de 1891 à 2000. Il ne liste que les noms portés au moins 30 fois sur la période; les noms plus rares, soit 7,5 % des personnes, sont regroupés sous « autres noms » et ne peuvent pas être tirés. Ce fichier ne contient aucun accent : Hervé y figure sous la forme Herve et François sous la forme Francois.
- Les noms de famille comptent des naissances de 1891 à 2000, pas des personnes vivantes aujourd'hui. Ils ne reflètent donc ni l'immigration récente ni l'évolution des noms depuis 2000.
- Prénom et nom de famille ne sont pas liés. Les différences régionales et les deuxièmes prénoms ne sont pas encore dans les pages. Un prénom composé comme Jean-Pierre est tiré comme un seul prénom, avec sa fréquence réelle.
Pages non générées
Une page n'est générée que si ses données passent un contrôle : assez de prénoms, une source enregistrée et un texte suffisamment différent des pages sœurs. Toutes les pages prévues ont passé le contrôle lors de la dernière génération.