Affichage des articles dont le libellé est Population française. Afficher tous les articles
Affichage des articles dont le libellé est Population française. Afficher tous les articles

Découpage des régions

Picasso a eu sa période "bleue", moi j'ai ma période "répartition régionale des populations". C'est comme ça, quand Uranie, la muse des mathématiques vous choisit, c'est le destin d'un homme qui se déroule sous ses yeux.

Bref.


L'idée est donc d'utiliser de nouveau les informations dont nous disposons qui décrivent la position et la population de chaque commune française. Cette fois-ci nous allons voir comment il est possible de découper chaque région en zone contenant le même nombre d'habitants. (L'égalité entre les superficie n'est pas importante)

Le découpage

La manière de découper les régions en zones de même nombre d'habitants doit avoir pour but d'obtenir des zones respectant une certaine logique. Aux États-Unis, la manière de découper les zones s'appelle le gerrymandering et en France on appelle cela le découpage électoral. Normalement chaque zone doit être la moins étalée possible et respecter une certaine représentativité dans sa démographie et dans le respect de la géographie locale. Il existe des algorithmes très complets permettant d'optimiser tous ces critères. A chaque redécoupage il existe une rumeur supposant certains décideurs en profiteraient pour définir des groupements qui les favoriseraient aux élections suivantes. 

De notre coté on fera basique, un découpage géométrique avec comme critère principal de ne pas trop s'étaler quand même. La méthode que nous utiliserons principalement est de tester série de droite affines avec une angle allant de 0 à 180° et de définir des bandes séparant les communes et de finalement prendre le résultat qui minimise un certain critère. Le critère que nous cherchons à minimiser est celui de la distance maximale entre deux communes du même groupe (afin, d'éviter l'étalement). Évidemment, il est possible aussi de définir une multitude de critères à optimiser (la distance moyenne entre les communes du même groupe par exemple) .


Résultats



Nous allons tester notre mini fonction pour les cas à 2, 3, 4 et 5 groupes. Chaque groupe contient donc le même nombre d'habitants et est séparé par une droite dont la pente minimise notre critère de sélection. C'est pourquoi il est possible que d'un cas à un autre, la pente optimale soit différente.













Le découpage en bande semble relativement pertinent mais il est possible de définir des groupements qui assurent une plus grande compacité de chaque zone. L'inconvénient est que ces recherches de solutions sont beaucoup plus gourmandes en temps et plus compliquées à développer et que le résultat ne sera pas aussi symétriquement élégant. En revanche, je n'ai pas résisté à la tentation de tester des formes plus farfelues. Comme les découpages en rond :


en carré :


ou encore en croix:
Il est possible d'imaginer tout et n'importe quoi, la preuve.




Répartition des populations régionales

Je suis récemment tombé sur un tableau indiquant la population de chacune des 13 nouvelles régions de France métropolitaine issues de la réforme des territoires de 2015. Le constat le plus amusant concernait la fusion Auvergne - Rhône-Alpes puisque cela créait la deuxième plus grande région de France en terme de population avec 8 millions d'habitants (évidemment derrière Paris et ses 12 millions d'habitants). L'aspect amusant de la chose résidait surtout dans le fait que même avant la fusion, la région Rhône-Alpes était déjà largement devant le reste du peloton et l'ajout de l'Auvergne (avec seulement 1.3 millions d'habitants) n'a pas d'impact majeur sur le classement final.
Il existe donc un fort déséquilibre dans ce mariage et cela peu donner l'impression aux auvergnats, de n'être qu'une pièce rapportée qui sera délaissée dans les processus de décision.
Pour vérifier cela, j'ai donc essayé d'étudier comment se repartissaient les bassins de population dans les différentes régions françaises en étudiant les différences de densité. L'approche est la suivante : Pour une région donnée, nous allons chercher des zones  contenant x% de la population (pour cette étude j'ai choisi de trouver des zones contenant 25% de la population totale de la région).

Si une zone contenant 25% de la population occupe une surface représentant 25% de la surface totale de la région alors cette zone est "normalement" peuplée. Mais il existe des cas plus extrêmes. Il existe des zones très peu peuplées, par exemple, des zones occupant 50% de la surface totale de la région mais qui n'abritent que 25% de la population. A l'opposé, il existe des zones couvrant 9% de la surface d'une région qui elles aussi regroupent 25% de la population totale.

Méthode

La méthode pour trouver les zones "optimales" de chaque région (c'est à dire la zone la plus grande possible et la zone la plus petite possible contenant chacune 25% de la population) se résume en quelques étapes simples :
1- Extraire les données GEOFLA des communes d'une région donnée, qui contiennent les coordonnées GPS de chaque communes ainsi que les informations concernant leur surface et leur nombre d'habitants.

library('rgdal') 
# Chargement des données GEOFLA 
communes <- readOGR(dsn="COMMUNE",  layer="COMMUNE")
Region <- "AUVERGNE-RHONE-ALPES"
# Subset des communes de la region
comm <- communes[communes@data$NOM_REG %in% Region,]

2- Formatage des données et calcul des distances euclidiennes (à vol d'oiseau) entre le centre de chaque commune.

dat <- comm@data
# formatage 
dat$POPULATION <- as.numeric(levels(dat$POPULATION))[dat$POPULATION]
dat$SUPERFICIE <- as.numeric(levels(dat$SUPERFICIE))[dat$SUPERFICIE]
# Initialisation du tableau de sortie
Res <- data.frame(INSEE_COM=dat$INSEE_COM,SURF=NA)
# Calcul des distances entre communes
Dist <- as.matrix(dist(dat[,c("X_CENTROID","Y_CENTROID")])) 

3- Pour chaque commune on va ordonner les autres communes de la région en fonction de leur distance à la commune étudiée. Ceci, afin de faire une recherche concentrique autour de ce point, de la surface nécessaire pour regrouper 25% des habitants de la région.

 # On fait une boucle sur chaque commune
 for(i in 1:nrow(dat)){
   # 1 On calcule la proximité des autres communes
   ord <- order(Dist[i,])
   # 2 On calcule la somme cumulee de population
   CSPop <- cumsum(dat[ord,"POPULATION"])
   # 3 On trouve quelle liste de commune est necessaire pour atteindre
   # x% de la population
   ix=which(CSPop>0.250*max(CSPop))[1]
   # 4 On calcule la surface totale de cette zone
   surf = sum(dat[ord[1:(ix-1)],"SUPERFICIE"])
   # 5 On affecte le resultat dans le tableau final
   Res[i,"SURF"]<-surf
 }

Résultats 

On peut alors trouver la commune qui est le centre de la plus petite zone contenant 25% de la population totale et la commune qui est le centre de la plus grande zone contenant 25% de la population. Il est alors possible de créer une carte montrant ces deux zones. Nous obtenons le résultat suivant :
En orange, la plus petite zone "circulaire" qui concentre 25% de la population de la région. 
En bleu, la plus grande zone "circulaire" contenant seulement 25% de la population de la région. Il y parfois certaines communes colorées en vert, ce qui indique qu'elles se trouvent à cheval dans les deux zones.
En gris, les communes qui ne sont dans aucune de ces deux zones extrêmes (et qui représentent donc les 50% restant de la population de la région) 
Pour synthétiser : Dans la zone bleu il y a autant d'habitants que dans la zone orange, c'est à dire un quart de la population totale de la région à chaque fois.


Pour la région Alsace Champagne Ardennes Lorraine, la zone orange recouvre les villes de Strasbourg, Mulhouse et Colmar et concentre donc 25% de la population de la région mais ne représente que 9% de la surface totale de la région. De l'autre coté, on trouve une zone 6 fois plus grande (et qui représente donc 54% de la surface de la région) et qui elle aussi ne contient que 25% des habitants. Il s'agit donc d'une zone 6 fois moins peuplée et qui recouvre les villes de Troyes et Reims mais aussi beaucoup de communes de taille plus faibles.

Pour la région Aquitaine Limousin Poitou Charentes, évidemment la zone autour de Bordeaux est celle qui concentre en le moins d'espace possible 25% de la population et sans surprise, la zone autour de Guéret et Limoges fait honneur à sa réputation et se doit donc d'être beaucoup plus étendue afin d'elle aussi contenir 25% de la population.

  
Pour la région Auvergne Rhône Alpes, on constate sans surprise qu'une petite zone contenant Lyon et Saint-Étienne et qui couvre seulement 4% de la surface de la région concentre autant de population qu'une zone occupant 43% de la surface totale. L'obligation que nous nous sommes imposé d'avoir une zone circulaire implique dans ce cas un chevauchement au niveau de la ville de Saint-Étienne. Si l'on avait décidé d'une autre forme, nul doute que toute l'Auvergne aurait pu apparaitre en bleu ciel. Ceci reste un véritable exploit puisque l'est de la région est occupé par les Alpes qui ne sont pourtant pas extrêmement densément peuplées non plus (à l'exception de Grenoble).

Pour la Bourgogne Franche Comté, il est possible de trouver une zone moins peuplée que la région Besançon-Belfort-Montbéliard mais pour cela il faut aller du coté de Nevers et Auxerre. Là on sera d'accord pour dire que ça reste relativement désert dans les deux cas quand même.
En Bretagne, de manière prévisible, c'est le secteur de Rennes qui possède une plus forte densité de population et c'est plutôt le centre Bretagne qui est moins peuplé. Les zones en grises ne sont pas forcement les moins peuplées (Brest, Rennes, Lorient) mais elles ne le sont pas autant que la zone nord-est.

Dans le Centre - Val de Loire c'est la zone à proximité de Tours qui concentre le plus la population et sans surprise, on est moins dérangé par les voisins du coté de Bourges et Vierzon (même si on est globalement jamais dérangé par les voisins n'importe où en Centre Val de Loire)

En Corse, on arrive très vite à des extrêmes. Ainsi, 25% de la population de l'île se retrouve regroupée sur une zone occupant 2% de l'espace total (autour d'Ajaccio) alors qu'une zone immense occupant le centre de l'île et représentant 57% de la surface totale de la région regroupe elle aussi la même quantité d'habitants (cette zone étant principalement montagneuse)
Pour la région Ile de France c'est évidemment sans surprise. La comparaison n'est même pas nécessaire. Sachez cependant que dans le coin de Melun et Provins, c'est 50 fois moins dense environ qu'à Paris.

Pour la région Languedoc Roussillon, le résultat est moins impressionnant car les deux zones optimales se chevauchent de manière importante. Dans le cas de la zone orange, il s'agit de la zone Toulouse - Castres - Albi alors que dans la zone bleue, elle regroupe tout l'arrière-pays (Lozère, Aveyron...). En effet, là aussi, les zones côtières restant relativement densément peuplées (Montpellier et Nîmes par exemple)

Un bien élégant résultat que celui du Nord Pas de Calais-Picardie. Montrant l'importante densité autour de Lille et Lens qui représente seulement 4% de la surface totale et les zones plus clairsemées de l'Oise et des alentours où 25% de la population occupe 49% de la surface totale, soit une zone 12 fois moins peuplée. Ceux qui se sont déjà perdu en forêt de Compiègne comprendront.

En Normandie, c'est la zone Rouen - Évreux qui regroupe en un minimum d'espace 25% de la population. On retrouve aussi Évreux dans la zone la moins densément peuplée, mais cela est principalement lié à sa proximité avec la zone sud de la Normandie, avec l'Orne et le sud Calvados où la densité de population est plus faible puisqu'elle se rapproche de la densité du nombre de vaches au kilomètre carré.

Un résultat bien propre pour les Pays de la Loire. La région nantaise représente 9% de la surface mais contient autant d'habitants que la Mayenne et la Sarthe. Il faudra donc que nos amis mangeurs de rillettes fassent attention à ne pas se fâcher avec leurs voisins petits beurres.

Dernier exemple illustrant de manière flagrante la surpopulation en bord de mer. Il existe une zone représentant 73% de la surface de la région Provence-Alpes Côte d'Azur qui n'est occupée que par 25% de la population totale. Cela signifie donc que les 75% d'habitants restant se concentre sur 27% de la surface de la région. Il existe même une zone autour de Marseille qui concentre à elle seule 25% des habitants (sur seulement 2% de la surface). Ils sont fadas ces sudistes.

Conclusion

Pour finir, j'ai développé une application shiny (que je ne peux hélas pas rendre publique sur shinyapps.io car trop gourmande en mémoire). Elle permet à l'utilisateur de choisir sa région à étudier, mais aussi de modifier le percentile analysé (pas nécessairement 25%). Un recalcul des zones optimales est alors effectué. Il existe aussi la possibilité pour l'utilisateur ce cliquer sur la carte afin de centrer le calcul sur une zone de son choix et de constater quelle zone est nécessaire pour regrouper les x% de la population demandée. A défaut d'une appli, vous pouvez au moins voir une petite vidéo de démo (qui vous prouve que je ne raconte pas des balivernes)



Tous chez Ikea

A quelle distance êtes-vous du stock d'armoire Billy le plus proche?


Cet article est intégralement non-sponsorisé par Ikea (mais si ils veulent m'envoyer un chèque c'est avec plaisir)

Cartographie de la distance de chaque commune à l'Ikea le plus proche

L'idée est de calculer pour chaque commune la distance (ou le temps de trajet) à l'Ikea le plus proche. L'objectif est de montrer les différences dans la répartition sur le territoire français (et donc les déserts ikeesques). 
A la question "pourquoi faire cette étude sur les Ikea et pas sur quelque chose de plus intelligent?" je répondrais en deux points :
1- Parce qu'Ikea fournit généreusement les coordonnées GPS de ces magasins (pour que vous puissiez les mettre dans votre GPS préféré - malin). Il serait plus intelligent de faire la même étude sur les hôpitaux ou les casernes de pompiers par exemple, mais il faut affronter les limites de l'open data.
2- Parce qu'il n'y a qu'une trentaine d'Ikea en France (et vous comprendrez par la suite que le nombre de distances à calculer peut-être très coûteux - en temps et en argent)

Premier essai : Les distances à vol d'oiseau

En se basant uniquement sur les coordonnées GPS des magasins et les coordonnées GPS du centre de chaque commune en France (données disponibles un peu partout) il est possible de calculer une matrice de distance à vol d'oiseau entre les 33 Ikea français et les 36 000 communes. Cela revient à calculer 1.2 millions de valeurs. On peut ensuite réaliser une carte où la surface de chaque commune est associée à une couleur qui est proportionnelle à la distance à vol d'oiseau de l'Ikea le plus proche.



Que nos amis corses ne m'en veulent pas (pitié ne tirez pas). L'Ile de beauté ne possédant pas d'Ikea, j'ai préféré ne pas la prendre en compte afin de ne pas biaiser les valeurs présentées sur la carte.
Les distances étant calculées à vol d'oiseau, les couleurs se répartissent donc en cercles concentriques autour de chacun des magasins puisque les infrastructures routières ne sont pas prises en compte. Cette carte est donc principalement utile pour les gens se déplaçant en hélicoptère ou en jet-pack (même si je ne vois pas trop comment une personne en jet-pack pourrait transporter une commode NORDLI avec ses douze tiroirs, enfin bon, c'est pas mon problème)  

La ligne de partage des eaux (ou des Ikea)

Une ligne de partage des eaux est une limite géographique qui divise un territoire en un ou plusieurs bassins versants. Toutes les pluies et les rivières présentent dans un de ces bassin finira invariablement dans le même fleuve ou le même océan. On peut adapter ce type de découpage pour regarder les zones couvertes par chacun des Ikea. Chaque commune est ainsi associée a son Ikea le plus proche. On peut donc visualiser le "territoire" couvert par chacun des magasins. Dans le cas des distances à vol d'oiseau cette construction est purement géométrique et revient à réaliser les diagrammes de Voronoi. Pour rappel, le diagramme de Voronoi est construit de telle sorte que chaque zone ne contienne qu'un seul Ikea et regroupe l'ensemble des communes les plus proches de cet Ikea. On obtient alors des séparations en lignes droites qui sont les bissectrices de chaque combinaisons de segments de magasins contigus.
[NDLA : Si vous êtes daltonien vous pouvez passer directement au paragraphe suivant. L’intérêt informatif de cette figure est de toute façon limité mais les diagrammes de Voronoi c'est quand même vraiment trop classe]

Diagramme de Voronoi / Bassin versant

Deuxième essai : Les temps de trajet (et distance) en voiture

Dans cette seconde phase, on chercher à calculer le temps de trajet et non plus la distance à vol d'oiseau entre les différents points d’intérêt. Ce type de résultat est effectivement plus intéressant mais pour pouvoir réaliser ces calculs, la géométrie ne suffit plus, il faut passer par des sites de guidage capables de définir des trajets (on pensera à google map, viamichelin...) Ces sites proposent souvent une API qui permet d'effectuer des requêtes sans passer par le navigateur. C'est évidemment très pratique mais l'inconvénient et que le nombre de requête est souvent limité (au moins dans la version gratuite). Cela peut se comprendre puisque d'autres sites utilisent ces requêtes afin d'étoffer leur offre, il est donc normal, en cas d'utilisation commercial de payer pour ce service. Dans le cas de google map, le tarif est d'environ 4$ pour 1000 requêtes. Sachant que l'on souhaiterait (dans l'idéal) calculer 1 million de valeurs, on arrive environ à 4000$.... (Chez Bing la limite semble être de 500 000 requêtes par an mais j'ai rencontré des soucis à l’inscription #RaconteTaVie) 
La solution permettant de ne pas avoir à calculer l’intégralité des 1.2 millions de distance consiste à ne calculer que le temps de trajet et la distance par la route à l'Ikea le plus proche a vol d’oiseau de chaque communes. Cela revient donc a calculer 36000 distances, c'est déjà mieux. Avec l'API route.api.here.com j'ai pu, (après correction des temps de trajets qui étaient sous-estimés) obtenir la carte suivante :


Temps de trajet à l'Ikea le plus proche
On peut réaliser la même chose avec le nombre de kilomètres (non plus à vol d'oiseau mais par la route). Là ça devient intéressant.

Distance par la route à l'Ikea le plus proche

Qualité de la couverture

La distance et le temps de trajet à l'Ikea le plus proche ont été calculées pour chaque commune. Comme nous connaissons aussi la population de chacune de ces communes  il est alors possible de déterminer trois choses :
1- Quel pourcentage de la population française habite à moins de X km ou de X minutes d'un Ikea?
2- Quel Ikea possède le plus de clients potentiels? (en supposant que les gens vont à l'Ikea le plus proche de chez eux) Ce qui équivaut à calculer la taille de chaque "bassin versant" (non pas en surface mais en population)
3- Quel endroit serait optimal pour installer un nouvel Ikea?

Pour la première question :

La courbe bleue décrit les temps de trajet (il faut regarder l'ordonnée à gauche du graphique). On constate que 20% des français habitent à moins de 15 minutes d'un magasin et que 75% des français habitent à moins d'une heure. L'objectif des dirigeants d'Ikea est d'avoir 80% de la population française à moins d'une heure d'un de leur magasin[1] d'ici 2020. Ils n'en sont apparemment pas loin.
La courbe orange représente les distances par la route. On constate que la moitié des français habite à moins de 50 km d'un magasin (il faut regarder l'ordonnée à droite du graphique)

Pour la seconde question : 

Comme l'a dit Confucius, une image vaut mille mots. On constate évidemment que les surfaces occupées par les Ikea parisiens sont très faibles mais ont d'importants bassins de population. A l'opposé les Ikea de Clermont-Ferrand et de Dijon couvrent des zones très étendues sans forcément concerner un nombre important de clients. Les résultats les plus surprenant sont pour le sud-est, où l'on trouve deux Ikea à Marseille, un à Toulon et un à Avignon qui donnent l'impression de se marcher un peu sur les pieds (enfin c'est mon avis).

 Pour la troisième question : 

En regardant les cartes, on constate rapidement une zone délaissée par nos amis scandinaves autour de Limoges. Il pourrait donc être intéressant de voir l'impact qu'aurait l'installation d'un Ikea à Limoges (sur les temps de trajets et sur les tailles de bassin de population). Pour réaliser ce calcul il suffit de rajouter un Ikea "virtuel" situé à Limoges et d'effectuer à nouveau les calculs sur les temps de trajets et les distances.

Carte des temps de trajets mise à jour

C'est quand même mieux non?

Qualité de la couverture mise à jour

Les lignes pointillées représentent la nouvelle distribution en supposant que l'Ikea de Limoges existe. J'avoue être un peu déçu, j’espérais voir une plus grosse différence. On arrive à réduire les temps de trajet mais on est toujours pas à 80% de la population française à moins d'une heure de route d'un Ikea.
C'est mieux, mais il reste du boulot

Taille des bassins mise à jour

 De manière évidente, l'ouverture d'un Ikea à Limoges aurait un impact direct sur les Ikea alentours. Clermont-Ferrand serait le plus impacté, passant d'un bassin de 2.06 millions d'habitants à 1.36 millions soit une diminution d'un tiers. Bordeaux et Tours perdraient environ 20% de leur population. Toulouse est aussi légèrement impactée avec une perte théorique de 3% (je ne l'ai donc pas représenté sur ce graphique)

Je ne suis pas certain que Limoges soit un bon emplacement pour installer un nouvel Ikea. Il aurait tendance à beaucoup pénaliser les magasins alentours. Malgré tout, cette zone reste très loin des magasins limitrophes. En tout cas, si j'habitais à Limoges (Dieu m'en préserve) j'attendrais quand même un peu avant de faire la route pour aller acheter ma nouvelle armoire suédoise, avec un peu de chance, ça ne devrait pas tarder. Il est à noter que la prochaine ouverture de magasin se fera en 2019 à Nice (raté pour Limoges). Cela devrait encore augmenter la fragmentation des bassins dans le sud-est (non, je ne parle pas des fractures des bassins des personnes âgées vivant sur la cote d'Azur).

Que faire si vous n'aimez pas Ikea?

Si vous adorez les Ikea, c'est simple, il suffit de déménager directement à l’intérieur du magasin, vous dormez dans un AKSVOL et mangez à la cantine. En revanche si vous haïssez les Ikea et tout ce qui est suédois en général (les krisprolls, Björn Borg..) alors je vous conseille évidemment de déménager en Corse ou de vous installer dans la commune de Py dans les Pyrénées Orientales qui est la commune française la plus éloignée d'un Ikea.
- Maman, quand est-ce qu'on arrive?
Tais-toi Ingmar!

[1]http://www.lefigaro.fr/societes/2010/09/29/04015-20100929ARTFIG00399-ikea-va-ouvrir-12magasins-en-france-d-ici-a-2020.php

Les prenoms unisexes (ou pas)


Les prénoms unisexes mais pas trop


On connait les prénoms qui peuvent être donnés indépendamment aux garçons et aux filles sans que cela ne choque trop (on pensera au classique "Dominique"), la règle étant que le prénom s'écrive de la même façon (exit donc la comparaison Pascale / Pascal).

Il peut être intéressant de regarder l'ensemble des prénoms qui ont été donnés aux deux sexes. Pour ce faire, on utilisera à nouveau les données de l'INSEE qui liste pour chaque année le nombre de fois où chaque prénom a été donné en France pour chacun des sexes année par année depuis 1900 (à condition que celui-ci ne soit pas trop rare : ie au moins donné 3 fois) 

Il y a alors deux choses à regarder pour ces prénoms : leur fréquence totale et le ratio du nombre de fois où ce prénom a été donné à un garçon par rapport au nombre de fois où il a été donné à une fille. Dans le meilleur des cas, ce ratio est de 1 (c'est a dire qu'il y a autant de garçons que de filles qui portent ce prénom). On peut considérer que jusqu’à un ratio de 5 ou 6 on reste dans des rapports raisonnables (cela veut dire qu'il y a 5 à 6 fois plus de garçons qui portent ce prénom que de filles - ou l'inverse). Le prénom peut encore être considéré comme unisexe (c'est à dire qu'on entend régulièrement les deux versions de ce prénom.)

En ce limitant aux comptage des prénoms donnés depuis 2000 (donc récents afin de réduire les contestations sur les changements de mode), le top des prénoms avec un bon ratio (inférieur à 6) et un nombre important d’occurrences (prénom donné au moins 4000 fois) est :


Prénom    Nb Garçons    Nb Filles    Ratio
Alix 3373 11983 3.6
Andréa 3447 11677 3.4
Angel 3558 720 4.9
Charlie 6173 6934 1.1
Eden 10903 8325 1.3
Jessy 3972 839 4.7
Loan 9958 1878 5.3
Loïs 4521 2058 2.2
Louison 3335 3967 1.2
Mae 1766 2726 1.5
Mahé 5895 1008 5.8
Noa 27903 4788 5.8
Sasha 7548 5734 1.3
Swann 3226 1446 2.2


Donc là c'est quand les choses se passent bien, mais il est possible que les ratios soient beaucoup plus élevés, cela signifie que les prénoms sont quasiment exclusivement donnés à des personnes d'un sexe et pas aux autres. Il faut noter que la précision du calcul de ces ratio est moins fiable car l'INSEE ne comptabilise pas les années où le prénom a été donné moins de 3 fois. Ainsi il n'est pas rare de voir un prénom donné 3 fois une année et ne pas être comptabilisé les autres années (alors qu'il est peut-être apparu une ou deux fois). Cela biaise un peu les résultats.

On peut néanmoins présenter dans un tableau les prénoms avec un ratio (estimé) supérieur a 1000 (cela veut dire qu'il y a 1000 fois plus de garçons qui portent ce prénom que de fille, ou inversement.) et des prénoms donnés plus de 20000 fois depuis l'an 2000.

Le tableau se lit de la manière suivante : Entre 2000 et 2017, il y a eu 52000 garçons qui ont été nommés Adam et 48 filles qu'on a appelé Adam. Il y a donc 1096 fois plus de "Adam"-garçons que de "Adam"-fille. Pour les Ambre, il faut prendre le résultat avec plus de pincettes car il semble seulement y avoir 3 Ambre depuis 2000 mais peut-être qu'il y en a eu d'autres années mais passant sous le seuil des 3 et donc non-comptabilisés.



Prénom    Nb Garçons    Nb Filles    Ratio
Adam 52627 48 1096
Ambre 3 36036 12012
Elise 19 25218 1327
Enzo 99856 7 14265
Gabriel 69733 9 7748
Inès 13 68176 5244
Léa 5 104370 20874
Léo 71527 18 3973
Lilou 11 41053 3732
Louane 20 22303 1115
Maelys 7 25684 3669
Marie 3 50295 16765
Marion 12 21980 1831
Mathilde 3 43943 14647
Mohamed 38144 3 12714
Morgane 21 22356 1064
Nolan 41165 6 6860
Rayan 321137 12 2678
Sarah 7 70655 10093
Yanis 50228 4 12557
Zoé 20 45938 2296


En regardant les statistiques depuis 1900 on trouve le même genre de résultats, 202 Roger, 186 Henri, 162 Louis, 144 Jacques, 132 David ou encore 118 Christophe chez les filles par exemple. Et pour les garçons on a 120 Sylvie, 117 Nathalie, 102 Suzanne, 94 Germaine... la liste est longue avec 157 prénoms vus plus de 10000 fois depuis 1900 et avec un ratio supérieur a 1000.


Les prénoms qui changent de sexe


Une autre information amusante a regarder et celle de l'évolution de l'attribution de certains prénoms  au fil du temps. Nous revenons alors aux données depuis 1900 et ne gardons que les prénoms donnés assez fréquemment (au moins 500 fois à chaque sexe). Il est alors possible de représenter graphiquement l’évolution de la proportion de fille et de garçons à qui ces prénoms ont été attribués. (J'ai subtilisé cette jolie représentation en log en base 2 à Baptiste Coulmont @coulmont que j'ai agrémenté à ma sauce)

Les 12 graphiques suivants se lisent tous de la même manière. En abscisse les années. Celles-ci ne s'étalent pas forcement toutes de 1900 à 2017, un filtre a été appliqué pour ne conserver que les périodes où ces noms ont été donnés à des garçons et des filles.
En ordonnée la proportion de garçons ou de filles a qui ce prénom a été attribué. Chaque année est représentée par un nombre (qui correspond au nombre d'enfant né cette année-là et portant ce prénom - garçons et filles confondues, mais la position du point correspond à la proportion garçon/fille. Ces valeurs ce lisent sur la gauche du graphique. On peut lire par exemple, "4 fois plus de garçons que de filles portent ce prénom". Les valeurs proches de la ligne horizontale noire indique qu'il y a autant de garçons que d filles qui portent ce prénom (il est donc parfaitement unisexe). Si les valeurs son en dessous (dans la zone rose) cela signifie que ce prénom a plutôt été porté par des filles, si la valeur est dans la zone bleue cela signifie que ce prénom est plutôt porté par les garçons.
J'ai aussi ajouté les intervalles de confiance de ces valeurs (ce qui est intéressant surtout pour les effectifs faibles) ainsi qu'une courbe orange qui montre la tendance générale.

Les 12 prénoms avec les résultats les plus intéressants sont donc :

ALIX : Prénom actuellement plutôt féminin (4 fois plus de filles que de garçons qui s’appellent Alix) sauf durant une période entre 1930 et 1960 où le rapport était plus équilibré
Cliquez pour zoomer

CAMILLE : Prénom extrêmement fréquent (donné plusieurs milliers de fois par an depuis les années 80) qui était plutôt masculin jusqu'en 1960 (ou 2 Camille sur 3 étaient des garçons) mais qui est devenu extrêmement féminin dans les années 2000 (où il y avait 20 fois plus de Camille-fille que de Camille-garçon). Cette tendance semble retourner vers la moyenne (affaire à suivre)
Cliquez pour zoomer
CHARLIE : Prénom anciennement très masculin dans les années 80-90. Depuis 2000 il est devenu plus féminin. 
Cliquez pour zoomer

CLARENCE : Prénom qui, en 1985 était plutôt donné à des filles mais est devenu plus masculin actuellement. Les effectifs sont malgré tout très faibles (moins de 100 Clarence par an, très loin des 4000 Camille par an)

Cliquez pour zoomer
DANY : Prénom plutôt rare jusque dans les années 40 (moins de 100 par an), on constate une forte augmentation dans les années 50 (600 par an) et depuis les années 60 ce prénom devient plutôt masculin et la tendance va en s'accentuant avec désormais 20 fois plus de garçons que de filles.
Cliquez pour zoomer
DOMINIQUE : Prénom relativement fréquent et très masculin jusque dans les années 40 (500 par an) il a ensuite explosé dans les années 50-60 avec plus de 20000 enfant portant ce prénom et une répartition proche des 50/50 entre les garçons et les filles. Il est depuis retourné dans un certain anonymat et est désormais de nouveau porté principalement par des garçons. 
Cliquez pour zoomer

EDEN: Prénom dont le nombre d’occurrence augmente fortement et qui se "masculinise" depuis 2010.
Cliquez pour zoomer
JACKIE : Prénom anciennement masculin dans les années 30 et qui est devenue plus féminin dans les années 60 (peut-être un effet Jackie Kennedy - ou Jackie Sardou, c'est au choix) mais avec une fréquence d'apparition très faible. 
Cliquez pour zoomer

JOAN : Prénom anciennement unisexe et désormais masculin.Tout comme Jackie, il doit y avoir des origines anglaises dans l'attribution de ce prénom (la traduction de Jeanne d'Arc en anglais étant Joan of Arc par exemple) 
Cliquez pour zoomer

JORDANE : Prénom assez rare dont l'apparition remonte aux années 80. Auparavant plutôt donné à des garçons, il y a désormais 4 fois plus de filles que de garçons qui portent ce prénom (probablement que les garçons sont nommés Jordan sans le E final)

Ajouter une légende


NOA: Un énorme merci a tous les Noa garçons (et les quelques Noa fille) parce qu'on obtient une magnifique courbe bien lisse.


Cliquez pour zoomer
YANNICK : On finit avec un prénom étonnant, Yannick. Évidemment prénom masculin. Je dis "évidemment", mais dans les années 50 il n'y avait que 4 fois plus de garçons que de filles qui portaient ce prénom. Depuis les années 1990, ce rapport est passé a 50 pour 1.
Cliquez pour zoomer