Affichage des articles dont le libellé est Graphiques. Afficher tous les articles
Affichage des articles dont le libellé est Graphiques. Afficher tous les articles

Squid Game : Game 5 probability

 

Introduction

This is the year 2021 and the world only talks about one thing : the new Netflix tv Show called "Squid Game" (no, nobody talks about the coronavirus anymore, it's too 2020). 

Warning : limited spoilers ahead.

The show tells the story of a groups of people that have to go through a serie of tests where, each time, some of the contestants will be definitively eliminated from the game. In the episode 7, we will attend to the 5th test out of the 6 planned in the competition. This test relies partially on probability and luck.

The design

!! SPOILERS AHEAD !!

At this point of the game, there are only 16 contestants left. The test consists on 18 rows of two tiles each. The contestants will have to go one by one on each of these 18 rows. For each row, he will have to select between two tiles (left or right) but, one of the two tiles of each row is trapped (and the other one is safe) and if a contestant steps on the trapped tile, he will fail the test and be eliminated. (I tried to be vague in the description to avoid as much to spoil as I can).

To summarize, for each row, a contestant has one chance out of two to be eliminated and one chance out of two to go to the next row. Also, in this game, order really matters because even if the first contestant as to rely on his luck to guess correctly 18 times in a row the good answer in order to go through all the rows (he has one chance out of 2^18 to succeed). The following contestants knows what were the good and the bad tiles for each rows that the previous contestants already manage to go through.

For example, if the first contestant succeed at the first row, selecting the left tile and fail at the second row choosing the right tile, the second contestant already knows for sure the good answer for the first two rows : they are in both cases the left ones. Which means he just have to try is luck on the last 16 remaining rows which slighlty increases its chances. And the probability to have somebody able to go through the 18 tiles increases for each following contestant.

The question is to know, what are the probabilities for any number of contestant to succeed at the game. We already know that the probability to have 16 successful contestant out of 16 means that the first player should not be eliminated and then should guess correctly the 18 good tiles, meaning one chance out of 262 144.

But what are the probabilities to have 15, 14, 13 succesful players?

"Squid Game" has zero chance of clearing through the glass bridge

Simulations

The basic way to know the answer is to run computer simulations, test plenty of cases and have an estimation of the repartition of the outcome (ie the number of successful player).

R code to run such a simulation looks like this :

NPlayers = 16
NRows = 18
# Function to count the number of successful people going one by one
Success = function(Sampling) {
  vec = array(NA, dim = ncol(Sampling))
  playerid = 1
  TileId = 1
  while (playerid <= nrow(Sampling) & TileId <= ncol(Sampling)) {
    if (Sampling[playerid, TileId] == 0) {
      # Bad tile selected the next player has to play
      # The next player will have the right i-th tile 
      #(because the previous contestant failed so he knows the right answer)
      playerid = playerid + 1
    }
    vec[TileId] = playerid
    TileId = TileId + 1 # Next row
  }
  # Return the number of succesful people
  if (any(vec > nrow(Sampling))) return(0) else return(nrow(Sampling) - vec[length(vec)] + 1)
}

Count = c()
for (iter in 1:1000000) {
# Basic random simulation of each participant walk
# don't take into account their previous steps
  Sampling = matrix(sample(c(0, 1), size = NPlayers * NRows, replace = T), ncol = NRows)
  Count[iter] <- Success(Sampling)
}
table(Count)


Which gives this kind of result :

Even if the bar does not appears on the graph, there are some cases where 13, 14, 15 and 16 people manages to go through but the values are so small they don't show up. From the simulation we can see that in this configuration ( 16 players and 18 rows ) more than 50% of the time 6 to 8 players will succeed. These are the most common occurences. 

Results based on 1 million simulations :

N SuccessN OccurencesObserved Probability
1 time out of ...
06511536
13 009332
211 65886
332 90130
470 535 14
5121 4818
6166 9216
7185 8165
8167 0266
9121 4088
1070 59514
1132 58530
1211 58386
133 154317
145971 675
157513 333
165
200 000

The theory says that there is one chance out of 262 144 to have 16 players that succeed, in our simulation it happened 5 times out of 1 million, hence once each 200 000 trials, which is close to the theoretical value.

Analytical results

After creating a rough estimation of each proportion we can try to be more accurate in the description. In our case we have N = 18 rows, each of them have 2 possibilities. This means there are 2^18 possible outcomes from people crossing all the rows. 

The case where no mistakes are made is unique and then appears once out of the 262 144 (2^18) cases. 

The case where 1 failure happened is not unique. The mistake can happened at row 1 or row 2 or row3, etc.. up to row 18. Which means there are 18 cases possible where only one error happened. Hence the probability of an outcome with one error represents 18 of the 262 144 cases.

For the cases with two errors, you have to list all the combinations of two positions among the 18 where the failure occurs. You have 18 possibility for the first error and 17 remaining possibilities for the second. Hence you have 18 x 17 = 306 possibilities. But be careful because you are counting twice the same results. For example the couple of error (10,2) and (2,10) are in fact the same. So you need to divide by two which leads to 153 unique combinations aomng the 262 144 cases.

For the case with three failures, method remains the same, you can count all the possibilities 18x17x16 = 4896 and divide by 6 (because each triplet of number have 6 different way to be sorted but are the same for us). Three failures happens 816 times out of 262 144.

The rest of the computation works the same way except for the 3 last cases. Because we are counting the number of players going through all the cases with 16 or more mistakes will leads to no player left. That is why we should groups them in the same value : "0 player remaining"

N SuccessProbabilityReal occurence
00.06%1524.09
10.31%321.25
21.17%85.67
33.27%30.6
47.08%14.12
512.14%8.23
616.69%5.99
718.55%5.39
816.69%5.99
912.14%8.23
107.08%14.12
113.27%30.6
121.17%85.67
130.31%321.25
140.06%1713.36
150.01%14563.56
160.0004%262144

Our simulated results were not too far from the reality.

Conclusion

SPOILER AGAIN

In the TV show, only 3 people manage to go through the 18 rows ( because, of course, nothing happened like it was supposed to) but in theory there should have been 6 to 8 people able to do it. The case where only 3 people manage to go through only happens 3% of the time and havig 3 person or less that manage to go through will only occurs with a probability below 5%.


 

Quelles générations de deputés ont occupé l'Assemblée Nationale ?

Les générations

Le concept sociologique des générations permet de définir des groupes de personnes, ayant approximativement le même âge et ayant donc vécus des évènements historiques similaires. La durée d'une génération correspond généralement au cycle de renouvellement d’une population adulte ce qui représente environ 20 ans.

Nous allons montrer l'évolution de ces générations dans la composition de l'Assemblée Nationale au fil des différentes législatures de la Vème République.

Les différentes générations

La segmentation en différente génération peut évidemment être sujette à débat car il n'existe pas réellement de règles pour les définir. Cependant, la partition des générations la plus couramment utilisée (et principalement dérivée de la sociologie et des études américaines sur le sujet) est :

La génération perdue, qui correspond aux personnes nées avant 1900 et qui ont donc connu la première guerre mondiale durant leur adolescence ou le début de leur âge adulte.

La génération grandiose (de 1901 à 1924) correspond aux personnes ayant grandi durant la grande dépression aux États-Unis et qui ont combattue durant le seconde guerre mondiale ainsi que ceux ayant participé à l'effort de guerre grâce a leur productivité.

La génération silencieuse (de 1925 à 1942) doit son nom au fait qu'elle aurait travaillé durement et ne pas avoir été revendicative. Ce terme est apparu dans un article du Times de 1951 et y caractérise les gens nés entre 1925 et 1942 comme des personnes fatalistes, conventionnelles, possédant un sens moral aléatoire, s'attendant au pire mais restant dans l'espérance.

Vient ensuite la plus célèbre des générations : les baby-boomers, nés à partir de la fin de la seconde guerre mondiale, ils bénéficient de la reprise économique et démographique qui a suivi le conflit.

Puis a partir de 1961 on trouve la génération X, qui se situe dans un moment de déclin social, mais aussi de mondialisation de l'économie et de déclin de l’impérialisme colonial. 

Enfin la génération Millénaire (ou les Millenials), aussi appelée génération Y, est une génération qui a connu les débuts de l'informatique (et un peu plus tard les débuts d'internet) et des jeux vidéos mais marque aussi les débuts de l’intérêt du grand public pour la question de l'écologie.

Les données

En regardant les dates de naissances des députés qui ont occupé l'Assemblée Nationale au cours de la Vème République il est possible de voir l'évolution de sa composition au fil du temps, les nouvelles générations remplaçant petit à petit les anciennes. Il existe évidemment un décalage entre les générations élues à l'Assemblée du fait de l'âge traditionnellement plutôt avancé de ses membres. Cependant le rajeunissement plutôt récent des élus implique donc que la démographie des élus de l'Assemblée tend à se rapprocher de la composition de la population active française (et donc par extrapolation, plus proche des aspirations de celle-ci).

Le site internet de l'Assemblée Nationale recense tous les membres de l'Assemblée, leurs dates de naissance ainsi que les législatures auxquelles ils ont appartenu. Il est a noter que bien que le nombre de personnes siégeant dans l'hémicycle n'a pas été constant dans l"histoire, il a varié de 482 a 579 depuis 1958 et a finalement été fixé à 577 en 1986. Il arrive aussi que les élus ne fassent pas un mandant complet et aient donc besoin d'être remplacés (pour cause de décès, de démission...). Ceci implique que le nombre de membre est donc très variable. C'est pour cela que les quantités représentées dans le graphique suivant sont exprimées en pourcentage afin de rendre les différentes législatures comparables entre-elles.

Le résultat

 

 

Friends


Évaluation des relations entre les personnages de Friends


Introduction

Cet article va expliquer en partie comment fonctionne actuellement ce blog. Je m'explique. Je regardais l'épisode 6 de la saison 1 de "The good place". A un moment, un personnage compare son amitié avec celle qui unie Ross et Phoebe (il ne maitrise pas trop les concepts d'amitié). Cette affirmation surprend l'autre personnage puisque, pour ceux qui ont suivi la série Friends, Ross et Phoebe sont probablement les deux personnages de la série qui se fréquentent le moins. Il existe des relations d'amitié bien plus fortes dans cette série (par exemple entre Chandler et Joey).




Analyse des relations


Pour tous les fans de la série il est évident que Ross et Phoebe n'ont (quasiment) pas de liens d'amitié. Je voulais voir si il était possible de confirmer cette évidence en s'appuyant sur des données chiffrées. Pour cela rien de plus "simple". En se basant sur le fait que deux personnes amies auront plutôt tendance à passer du temps ensemble nous allons essayer de comptabiliser le nombre de temps où deux personnages sont ensemble dans la même scène. Il existe alors deux solutions : la première consiste à regarder les 236 épisodes (comptez environ 86h) et de noter toutes les fois où les acteurs sont ensemble dans chaque scène. La deuxième solution (pour les grosses feignasses comme moi) repose sur deux éléments : Tout d'abord le site https://fangj.github.io/friends/ qui recense les scripts de tous les épisodes de Friends, chaque script contenant les dialogues et didascalies. Dans un second temps il faut extraire et formater les données. Coup de chance cela a déjà été fait par un autre blogger anglophone (Lien ici) qui a aussi réalisé une étude à ce sujet (mais qui ne répond pas à notre question). Dans son article il essaye de trouver quel personnage peut être considéré comme le personnage principal. Pour cela il compte la quantité de dialogue pour chaque personnage (ce qui constitue un indicateur de l'importance du personnage). La conclusion est que les scénaristes ont plutôt bien fait leur travail et la quantité de tirade pour chacun des acteurs est plutôt bien équilibrée tout au long de la série.

Bref, revenons à nos moutons. Nous avons désormais un jeu de données qui liste toutes les scènes de la série ainsi que la liste de chaque personnage qui a des lignes de texte dans chacune des scènes. Nous allons donc pouvoir compter le nombre total de scènes parlantes par personnage (c'est à dire où l'acteur parle) mais aussi le nombre de fois où il partage l'écran avec un autre acteur. On obtient donc une matrice 6 x 6 (puisqu'il y a 6 personnages principaux). Le résultat est le suivant.


Nombre de scènes en commun entre deux acteurs

Prenons le cas de Chandler. Au total Chandler apparait dans 1359 scènes (la série contient 2857 scènes au total). Sur ces 1359 scènes, il en partage 837 avec Joey et 881 avec Monica (ce qui semble logique, Chandler étant très ami avec Joey et en couple avec Monica pendant une bonne partie de la série). Ensuite, Chandler partage 687 scènes avec Ross et seulement 626 avec Rachel et 638 avec Phoebe (donc environ 30% de scènes en moins). Si l'on recherche les "couples" d'acteurs ayant le moins de scènes ensemble, on trouve bien le duo Ross-Phoebe avec seulement 602 scènes ensemble et, de manière plus surprenante, il n'y a que 607 scènes entre Ross et Monica (qui sont pourtant frères et sœurs).

Pour mettre en évidence ces relations, il est aussi possible d'aller un peu plus loin en comptant le nombre de scènes communes à chaque couple de personnages mais avec la condition supplémentaire qu'ils soient les deux seuls acteurs principaux à parler dans ces scènes (il peut y avoir d'autres personnages présents parmi les 6 principaux mais ils doivent seulement faire de la figuration de même qu'il peut y avoir des acteurs secondaires qui parlent). L'idée est de voir si chaque binôme peut avoir sa propre part de narration. Le résultat est le suivant :


Nombre de scènes à deux sans autres acteurs principaux

Cette fois-ci, le résultat fait la part belle aux couples d'amoureux (Monica-Chandler et Ross-Rachel). Il semble logique que ces couples puissent disposer de scènes entre eux afin de faire avancer leur relation amoureuse. On retrouve, un peu derrière, le "couple" Joey-Chandler. Parmi les 336 scènes de Chandler à deux acteurs, il en a 146 avec Monica et 111 avec Joey, les trois autres acteurs se répartissent les 23% de scènes restantes.
Une fois de plus, en queue de peloton on retrouve des couples "improbables" qui partagent à peine une vingtaine de scènes à deux. Il s'agit des couples Chandler-Phoebe, Ross-Monica (une fois de plus) et Chandler-Rachel. Les déséquilibres sont plus forts dans cette configuration puisque cela favorise les couples très importants pour le récit.

Une version moins "amoureuse" et plus "amicale" consiste à regarder les scènes avec des trios (c'est a dire exactement trois acteurs principaux qui parlent dans la même scènes). On obtient alors le résultat suivant :


Répartition des scènes avec trois acteurs


Dans ce dernier cas, on peut constater que c'est le couple Chandler-Joey qui repasse devant. Ils ont 155 scènes ensemble dont 67 avec Ross, 55 avec Monica, 17 avec Rachel et 10 avec Phoebe. Ainsi, en moyenne il n'y a qu'une scène par saison avec le trio Chandler-Joey-Phoebe, autant dire que c'est rare. La palme du trio le plus rare est Monica-Ross-Joey, qui n'ont que 5 scènes ensemble parmi toutes les scènes à trois.
Les trios les plus fréquents sont donc Ross-Chandler-Joey (avec 67 occurrences) et Monica-Rachel-Phoebe avec 60 occurrences. Cela confirme que les scènes à 3 personnages se déroulent plutôt dans le cadre amical alors que les scènes à deux sont plus liées aux relations amoureuses.





Carte des toilettes publiques de Paris


Et si on veut aller aux petits coins?


La vie est bien faite, la mairie de Paris propose en open data la localisation de toutes les sanisettes et toilettes de la capitale. On peut donc calculer la densité de sanitaires par km². On peut inclure dans le calcul les deux bois (de Vincennes et de Boulogne) puisque nous disposons de l’intégralité du positionnement des différents d'espaces d'aisance. Ici, les 644 points disponibles sont représentés. On supposera dans la suite de cet article que la base de données de la ville de Paris est exhaustive. Je n'ai pas les moyens, ni l'envie (hihihi) d'aller les vérifier une par une. Certains sanitaires de la ville semblent aussi être gérés sous forme de concession et peuvent ne pas apparaitre dans ces résultats. Chaque petit point foncé sur la carte représente une sanisette ou des toilettes.


La carte ci-dessus montre que le IVème arrondissement compte 18 sanitaires par km² suivi par le Xème et le XVIIIème. Les arrondissements les plus mal lotis disposent de moins de 5 sanitaires par km².

De manière plus précise, il est possible (et laborieux), de créer une grille virtuelle (ici il s'agit d'une grille 200 par 200) et à chaque point de cette grille on va évaluer le temps de marche a pied nécessaire pour atteindre les toilettes les plus proches. Pour cela on utilisera une API permettant de calculer les temps de trajet (comme ce que propose Google et plein d'autres sites). La limite de ces API est souvent le nombre de requête que l'on peut effectuer gratuitement ainsi que le temps de calcul. Pour estimer environ 20 000 distances il a fallut plusieurs heures.
Une fois cela fait, on peut alors colorier le résultat. Pour que les différentes zones soit plus facilement visibles, il a été décidé de classer chacun de ces points en cinq catégories en fonction du temps de marche : 

- Moins de 2 minutes de marche à pied aux toilettes les plus proches,
- Entre 2 et 5 minutes, 
- Entre 5 et 10 minutes,
- Entre 10 et 15 minutes et enfin 
- Plus de 15 minutes de marche à pied.
 

 
Évidemment les zones les plus délaissées sont les bois de Vincennes et de Boulogne où il faudra savoir anticiper vos besoins (sinon vous allez vous cacher derrière un arbre, il y en a plein). Il existe malgré tout des zones dans Paris intramuros où il faudra marcher quand même une dizaine de minutes avant de trouver le Graal de faïence.

Répartition par arrondissement

Le graphique ci-dessous représente la probabilité d'être dans chacune des catégories de temps pour chaque arrondissement. Ainsi, dans le XIIème arrondissement, vous aurez à marcher plus de 10 minutes dans la moitié des cas (principalement à cause du bois de Vincennes). On observe a peu près le même résultat pour le XVIème. Finalement, un arrondissement plus compliqué que prévu est le Ier arrondissement, que l'on pourrait supposer bien desservit de par sa position centrale dans la ville mais il y sera peu probable d'y trouver des toilettes sans marche au moins 5 minutes (2/3 des cas).

Conclusion

 

Cette analyse semble montrer une grande disparité dans la répartition des toilettes publiques de la capitale qui ne semble pas forcement liée à leur position respective (les arrondissement centraux ne sont pas nécessairement les mieux lotis).


Approximation de π grace au triangle de Pascal (le grand frère)

La formule de Leibniz pour approximer π


Il existe de nombreuses manières d'approximer le nombre π. Dans l'antiquité on se contenait d'approximer π au moyen de fractions plus ou moins complexes. Mais dès le Moyen-Age c'est par le biais de séries que l'on a pu avoir les meilleures résultats. Ces séries sont juste des suites (infinies) d'opérations qui, à chaque étape (ou itération) se rapprocheront de plus en plus de la valeur de π. L’inconvénient de cette méthode est que comme ces suites sont infinies, la précision du résultat dépend du nombre d’itération que l'on peut calculer ce qui est limité par le temps que l'on peut y passer et les moyens technologiques à disposition. 

La formule de Madhava-Leibniz fut calculée à l'époque pour les 21 premiers termes ce qui permis de trouver la valeur de π à la 11ème décimale :

Formule de Madhava-Leibniz

Vous pouvez tenter de calculer les 21 premiers termes à la main et me dire combien de temps ça vous a pris.

Une autre version intéressante est attribuée elle aussi à Leibniz, qui fut le premier à réellement l'expliciter (même si Gregory avait défini le cas général et que la formule de Leibniz en est dérivée pour un cas très simple). Elle est définie de la façon suivante :

Formule de Leibniz
Leibniz, hippie avant l'heure

Cette formule est très simple puisqu'elle consiste en une somme de fraction unitaires (c'est à dire de fractions où le numérateur vaut 1) divisée par tous les nombres impairs. C'est simple et facile à se rappeler. Cependant elle à l’inconvénient de converger trèèès lentement ce qui la rend globalement inutile en pratique. Il faut noter que ces nombres impairs composent la deuxième "diagonale"du triangle de Pascal (ça semble trivial mais cela a un intérêt pour la suite)




La formule de Toloza

Une autre version a été trouvée par Jonas Toloza en 2007[1] qui a crée une seconde série qui approxime π en utilisant une série de nombres particulière. La formule est la suivante :

Formule de Toloza

Ici on ne divise pas 1 par des nombres impairs, mais par une série de nombres (1,3,5,10,15,21...) qui se trouvent être ceux composant la troisième "diagonale" du triangle de Pascal. C'est là où ça devient amusant. Les gens se sont alors mis à chercher si il était possible d'utiliser les nombres issus des diagonales du triangle de Pascal pour créer ces séries.


A ce stade, on commence donc à voir où cet article veut en venir.

La formule de Hardisky


Plus récemment, en 2017, Hardisky[2] a trouvé aussi une suite utilisant un élément sur deux mais cette fois-ci dans la quatrième diagonale du triangle de Pascal. La formule étant la suivante :
Formule d'Hardisky




La démonstration des formules de Hardisky et Toloza se basent toutes les deux sur une transformation de la série de Nilakantha Somayaji (1444-1544, oui, c'est pas récent), mathématicien indien qui développa la série suivante :



Ces séries numériques ont vu leur convergence prouvée (oui, le but n'est pas juste de trouver une série qui semble tendre vers π, il faut aussi le prouver) Il existe aussi des formules pour les deux autres diagonales suivantes, elles se sont pas formellement prouvées mais c'est surtout parce qu'au final chaque diagonale possède cette propriété :







On constate ainsi que pour les séries utilisant les chiffres des "diagonales" paires (celles de Leibniz, Hardisky et pour la 6ème rangée) on utilise uniquement une valeur sur 2 et en alternant les signes + et -. Pour les diagonales "impaires", il semble qu'on utilise toutes les valeurs de la diagonale mais en faisant des paires d'additions et de soustractions.

Vitesse de convergence

 

Ces séries convergeant toutes vers π, il peut être interessant de voir si leur vitesse de convergence est très différente. Pour cela nous pouvons calculer les 100 premières valeurs pour chacune des formules et évaluer à chaque fois l'écart (en valeur absolue) entre la valeur obtenue et π. On cherche donc à obtenir une valeur qui se rapproche rapidement de 0.


Le graphique ci-dessus (avec l'axe des ordonnées exprimé en valeur logarithmique) montre que la méthode de Leibniz est bien celle qui converge le moins rapidement puisqu'en utilisant les 100 première valeurs on tombe péniblement à un écart de 0.01 avec π. Alors que plus les séries sont "évoluées" plus cette convergence est rapide.
Avec la formule de Toloza et celle pour la cinquième diagonale on observe des oscillations. Cela s'explique par le fait que la série n'alterne pas pour chaque terme addition et soustraction (comme c'est le cas pour les séries des diagonales paires), mais qu'elle fait des paires d'additions et des paires de soustractions, cela implique donc qu'on s'éloigne deux fois de suite de la vraie valeur puis on s'en rapproche deux fois de suite, ce qui lui donne cet aspect oscillatoire mais ne l'empêche pas néanmoins de converger vers la solution.
En calculant l'estimation par la méthode de Hardisky pour les 100 premières valeurs on obtient 3.1415924, on est donc correct pour les 6 premières décimales (d'où une erreur à 10e-6). Pour la version la plus aboutie on atteint 10 décimales exactes à l'issue des 100 premières itérations.

Conclusion

A notre époque, il existe des séries bien plus efficaces puisque chaque itération améliore la précision de plusieurs décimales à chaque itération (un des algorithme le plus utilisé trouve 8 décimales supplémentaires par itérations). L’intérêt réside donc plutôt dans la découverte de cette relation entre π et le triangle de Pascal qui n'ont a priori aucun rapport. Vous avez pu constater que les preuves "officielles" sont très récentes mais il semble très probable que ces propriétés soient connues depuis plusieurs siècles. Il est probable que personne ne s'est réellement embeté à le démontrer puisque l’intérêt est assez faible.

Réchauffement climatique

Introduction

La température du globe augmente, j'en suis certain (la preuve, il fait 28° dans mon salon alors qu'il n'est que 9h du matin). 

Données

Pour vérifier si l’augmentation de la température est limitée uniquement à mon salon où si celle-ci est plus étendue (peut-être qu'il fait chaud ailleurs aussi) nous allons utiliser des relevés de températures mondiaux. Ces données sont issues d'un regroupement de différentes sources réalisé par le Lawrence Berkeley National Laboratory, il s'agit de moyennes mensuelles prises dans 1366 stations réparties sur le globe. Les plus anciennes observations remontent à 1743 mais elles sont relativement incomplètes pour la plupart des stations et c'est seulement à partir de 1850 que les données sont disponibles de manière globale (ce qui est déjà bien). En Europe et en Amérique du nord les relevés semblent fiables à partir de 1750 environ.
Comme vous pourrez les constater, les stations ne sont pas équitablement réparties sur la planète. Il y en a beaucoup en Europe et en Amérique mais très peu en Océanie par exemple. Ceci implique que les moyennes globales qui seront faites par la suite ne représentent pas exactement la moyenne mondiale mais qu'elles seront légèrement affectées par la surabondance de données européennes et américaines. (Rien de bien méchant cependant).

Analyse des données mondiales de 1850 à 2013

Comme expliqué précédemment, l'analyse au niveau global des relevés de température se fera à partir de 1850 afin que toutes les stations aient des données complètes. Pour chacune de ces zones nous n'allons pas directement représenter les températures observées (car évidemment on verrait surtout qu'il fait plus chaud en Afrique qu'en Russie, merci Captain Obvious) mais nous allons plutôt étudier la différence entre la température annuelle et la température moyenne observée entre 1850 et 2013.

Par exemple, la température annuelle moyenne à Paris entre 1850 et 2013 est de 10.5°. En 1850 il a fait en moyenne 9.8° à Paris, la différence est donc de -0.7° (il a donc fait plus froid que d’habitude cette année-là). En 2013 il à fait 11° ce qui fait une différence de +0.5° (il a donc fait plus chaud que d'habitude cette année-là). C'est donc ces différences à la moyenne que nous allons étudier.

Le graphique suivant montre le résultat à l'échelle mondiale. Les points bleus foncés sur la carte représentent les zones qui ont été plus froides d'au moins 3° par rapport à la moyenne du lieu sur la période entre 1850 et 2013. Les points rouges représentent au contraire les zones où la température moyenne d'une année a dépassé de 3° la température actuellement observée sur cette zone. Si il y a un réchauffement alors on devrait observer de plus en plus de points rouge-orange et de moins en moins de points bleus au fil des ans (Spoiler : c'est le cas). Le graphique en bas de la carte montre lui l’évolution de la moyenne globale des températures des différents sites. Le résultat est sans appel, ça augmente.


Que s'est-il passé en 1864?

On constate une forte baisse de la température globale en 1864 (et aussi en 1865 et 1866). Après vérification, il s'agit principalement d'hivers très rudes en Europe centrale (et le reste de l'année était légèrement plus frais aussi). Les températures mensuelles observées étant parfois inférieures de 8° aux températures habituellement attendues à ces saisons. A Cracovie par exemple, on observait des -8° de moyenne en décembre à la place des -1° habituellement enregistrés.

Analyse des données françaises de 1754 à 2013

Pour les données françaises, nous allons remonter jusqu'en 1754. On ne remontera pas avant car des données sont partielles jusqu'en 1753. Le but va être de découper cet intervalle de temps en deux morceaux. Il y aura donc une partie avant 1900 et une partie après 1900. Cette partition va permettre de constater une différence dans la vitesse d’accroissement des températures observées en France. Entre 1787 et 1900, les températures varient peu (on constate même une légère diminution des valeurs moyennes d'environ -0.2°) alors que dans la deuxième partie (de 1900 à 2013) on constate une augmentation moyenne des températures d'environ +1.1°. 


 Conclusion

Il semble relativement évident que les températures moyennes augmentent, que ce soit au niveau global ou au niveau français (ou dans mon salon). Ces données ne permettent cependant pas d'expliquer si l'augmentation de ces valeurs est liée ou non à l'activité humaine (oui, toi lecteur du futur qui lit ce texte en 2100, sache qu'en 2019 il y avait encore un débat sur la proportion du réchauffement climatique imputable à l'activité humaine - bon, il faut dire que nous avons aussi des gens qui débattent encore sur internet de la platitude de la Terre... )