<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Analyse De Données on kenji.blog</title><link>http://kenji.blog/fr/tags/analyse-de-donn%C3%A9es/</link><description>Recent content in Analyse De Données on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>fr</language><copyright>kenjinote</copyright><lastBuildDate>Thu, 10 Sep 2026 07:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/fr/tags/analyse-de-donn%C3%A9es/index.xml" rel="self" type="application/rss+xml"/><item><title>Le paradoxe de Simpson : un phénomène mystérieux où l'on gagne par parties, mais où l'on perd au global</title><link>http://kenji.blog/fr/p/simpsons-paradox/</link><pubDate>Thu, 10 Sep 2026 07:00:00 +0900</pubDate><guid>http://kenji.blog/fr/p/simpsons-paradox/</guid><description>&lt;img src="http://kenji.blog/p/simpsons-paradox/img/simpsons_paradox.jpg" alt="Featured image of post Le paradoxe de Simpson : un phénomène mystérieux où l'on gagne par parties, mais où l'on perd au global" />&lt;h2 id="1-dans-quel-hôpital-devriez-vous-vous-faire-opérer-">1. Dans quel hôpital devriez-vous vous faire opérer ?
&lt;/h2>&lt;p>Vous êtes atteint d&amp;rsquo;une maladie grave et devez subir une intervention chirurgicale.
Vous avez le choix entre deux hôpitaux : l&amp;rsquo;hôpital A et l&amp;rsquo;hôpital B. Vous avez demandé les données sur le &amp;ldquo;taux de réussite&amp;rdquo; des opérations pour chaque hôpital.&lt;/p>
&lt;p>&lt;strong>【Taux de réussite global】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A&lt;/strong> : Sur 1000 personnes, 900 réussites (taux de réussite &lt;strong>90%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Hôpital B&lt;/strong> : Sur 1000 personnes, 800 réussites (taux de réussite &lt;strong>80%&lt;/strong>)&lt;/li>
&lt;/ul>
&lt;p>En voyant cela, n&amp;rsquo;importe qui penserait : &amp;ldquo;L&amp;rsquo;hôpital A est meilleur !&amp;rdquo;.
Cependant, étant de nature prudente, vous décidez d&amp;rsquo;examiner plus en détail comment les données varient selon la gravité de la maladie (cas légers ou cas graves).&lt;/p>
&lt;p>&lt;strong>【Taux de réussite pour les cas légers】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A&lt;/strong> : Sur 100 personnes, 99 réussites (taux de réussite &lt;strong>99%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Hôpital B&lt;/strong> : Sur 900 personnes, 870 réussites (taux de réussite &lt;strong>96%&lt;/strong>)
$\rightarrow$ Pour les cas légers, &lt;strong>l&amp;rsquo;hôpital A gagne (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【Taux de réussite pour les cas graves】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A&lt;/strong> : Sur 900 personnes, 801 réussites (taux de réussite &lt;strong>89%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Hôpital B&lt;/strong> : Sur 100 personnes, 70 réussites (taux de réussite &lt;strong>70%&lt;/strong>)
$\rightarrow$ Même pour les cas graves, &lt;strong>l&amp;rsquo;hôpital A gagne (89% &amp;gt; 70%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Tiens ? Ne trouvez-vous pas cela étrange ?&lt;/p>
&lt;p>Pour les patients &amp;ldquo;légers&amp;rdquo;, l&amp;rsquo;hôpital A a un meilleur taux de réussite.
Pour les patients &amp;ldquo;graves&amp;rdquo;, l&amp;rsquo;hôpital A a également un meilleur taux de réussite.
Et pourtant, quand on calcule le taux de réussite &amp;ldquo;global&amp;rdquo; combinant tous les patients&amp;hellip; ?&lt;/p>
&lt;ul>
&lt;li>Hôpital A Global : $(99 + 801) / 1000 =$ &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>Hôpital B Global : $(870 + 70) / 1000 =$ &lt;strong>94%&lt;/strong>&amp;hellip; non, selon le calcul précédent c&amp;rsquo;était &lt;strong>80% ?&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Attendez, regardons à nouveau les premières données.
Les premières données étaient les suivantes :&lt;/p>
&lt;ul>
&lt;li>Taux de réussite global de l&amp;rsquo;hôpital A : &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>Taux de réussite global de l&amp;rsquo;hôpital B : &lt;strong>80%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Mais si nous recalculons avec les données détaillées,
Le taux de réussite global de l&amp;rsquo;hôpital B devrait être de $(870 + 70) / 1000 = 940 / 1000 = $ &lt;strong>94%&lt;/strong>.&lt;/p>
&lt;p>&lt;strong>&amp;hellip; Eh oui, vous vous êtes fait avoir !&lt;/strong>
En réalité, cette astuce numérique est précisément le terrible piège statistique que nous allons expliquer cette fois.
Laissez-moi vous montrer les vraies données à nouveau.&lt;/p>
&lt;hr>
&lt;h2 id="2-à-vous-qui-avez-été-trompé--les-vraies-données">2. À vous qui avez été trompé : Les vraies données
&lt;/h2>&lt;p>&lt;strong>【Taux de réussite pour les cas légers】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A&lt;/strong> : Sur 900 personnes, 870 réussites (taux de réussite &lt;strong>96%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Hôpital B&lt;/strong> : Sur 100 personnes, 99 réussites (taux de réussite &lt;strong>99%&lt;/strong>)
$\rightarrow$ Pour les cas légers, &lt;strong>l&amp;rsquo;hôpital B gagne (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【Taux de réussite pour les cas graves】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A&lt;/strong> : Sur 100 personnes, 30 réussites (taux de réussite &lt;strong>30%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Hôpital B&lt;/strong> : Sur 900 personnes, 315 réussites (taux de réussite &lt;strong>35%&lt;/strong>)
$\rightarrow$ Même pour les cas graves, &lt;strong>l&amp;rsquo;hôpital B gagne (35% &amp;gt; 30%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>En d&amp;rsquo;autres termes, que ce soit pour les cas légers ou graves, &lt;strong>l&amp;rsquo;hôpital B est de loin supérieur&lt;/strong>.&lt;/p>
&lt;p>Alors, additionnons cela au niveau &amp;ldquo;global&amp;rdquo;.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Hôpital A Global&lt;/strong> : $(870 + 30) / (900 + 100) = 900 / 1000 =$ &lt;strong>Taux de réussite 90%&lt;/strong>&lt;/li>
&lt;li>&lt;strong>Hôpital B Global&lt;/strong> : $(99 + 315) / (100 + 900) = 414 / 1000 =$ &lt;strong>Taux de réussite 41%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Incroyable ! En regardant les données &amp;ldquo;partielles&amp;rdquo;, l&amp;rsquo;hôpital B gagne partout, mais en les combinant au niveau &amp;ldquo;global&amp;rdquo;, l&amp;rsquo;hôpital A remporte une victoire écrasante !
C&amp;rsquo;est ce phénomène que l&amp;rsquo;on appelle le &lt;strong>&amp;ldquo;Paradoxe de Simpson&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "Données partielles (Victoire de B)"
Light["Cas légers : Victoire de l'hôpital B (99% > 96%)"]
Heavy["Cas graves : Victoire de l'hôpital B (35% > 30%)"]
end
subgraph "Données globales (Victoire de A)"
Total["Total cumulé : Victoire écrasante de l'hôpital A (90% > 41%)"]
end
Light -->|Étonnamment, en combinant, cela s'inverse| Total
Heavy -->|Étonnamment, en combinant, cela s'inverse| Total
style Total fill:#ff9999,stroke:#333,stroke-width:2px&lt;/div>
&lt;hr>
&lt;h2 id="3-pourquoi-une-inversion-aussi-étrange-se-produit-elle-">3. Pourquoi une inversion aussi étrange se produit-elle ?
&lt;/h2>&lt;p>L&amp;rsquo;origine de ce paradoxe réside dans un &lt;strong>&amp;ldquo;déséquilibre des tailles d&amp;rsquo;échantillon (dénominateurs)&amp;rdquo;&lt;/strong> et la présence d&amp;rsquo;une &lt;strong>&amp;ldquo;variable cachée (facteur de confusion)&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;p>Regardez attentivement les données.&lt;/p>
&lt;ul>
&lt;li>L&amp;rsquo;hôpital A admet &lt;strong>une grande quantité (900 personnes) de &amp;ldquo;patients légers faciles à soigner&amp;rdquo;&lt;/strong>.&lt;/li>
&lt;li>L&amp;rsquo;hôpital B admet &lt;strong>une grande quantité (900 personnes) de &amp;ldquo;patients graves difficiles à soigner&amp;rdquo;&lt;/strong>.&lt;/li>
&lt;/ul>
&lt;p>Comme l&amp;rsquo;hôpital B est très compétent, il agit comme un &amp;ldquo;hôpital de la dernière chance&amp;rdquo; qui prend en charge de nombreux patients dans un état grave qui sont refusés ailleurs. Naturellement, le taux de réussite pour les patients graves est plus faible (35%). Le &amp;ldquo;taux de réussite global&amp;rdquo; de l&amp;rsquo;hôpital B est tiré vers le bas par cette grande proportion de patients graves, le faisant paraître globalement plus bas (41%).&lt;/p>
&lt;p>À l&amp;rsquo;inverse, l&amp;rsquo;hôpital A ne s&amp;rsquo;occupe que des patients légers et simples à traiter. Par conséquent, son taux de réussite global semble élevé (90%), mais à conditions égales (en comparant les cas graves entre eux, et les cas légers entre eux), il est moins performant que l&amp;rsquo;hôpital B.&lt;/p>
&lt;p>Exprimé mathématiquement, cela est dû aux propriétés de l&amp;rsquo;addition des fractions.
En général, même si $\frac{a}{b} &lt; \frac{A}{B}$ et $\frac{c}{d} &lt; \frac{C}{D}$,
il n&amp;rsquo;est pas toujours vrai que :
&lt;/p>
$$ \frac{a+c}{b+d} &lt; \frac{A+C}{B+D} $$
&lt;p>
Lorsque la taille des dénominateurs est extrêmement différente, le sens de l&amp;rsquo;inégalité peut s&amp;rsquo;inverser.&lt;/p>
&lt;hr>
&lt;h2 id="4-le-paradoxe-de-simpson-survenu-dans-le-monde-réel">4. Le &amp;ldquo;paradoxe de Simpson&amp;rdquo; survenu dans le monde réel
&lt;/h2>&lt;p>Ce paradoxe n&amp;rsquo;est pas qu&amp;rsquo;une simple énigme mathématique ; il se produit fréquemment dans la société réelle et a provoqué de grandes controverses.&lt;/p>
&lt;h3 id="accusations-de-discrimination-sexuelle-à-luniversité-de-californie-à-berkeley-en-1973">Accusations de discrimination sexuelle à l&amp;rsquo;Université de Californie à Berkeley en 1973
&lt;/h3>&lt;p>Lors d&amp;rsquo;une enquête sur les taux d&amp;rsquo;admission aux cycles supérieurs à Berkeley, il a été constaté que le &amp;ldquo;taux d&amp;rsquo;admission des hommes (44%)&amp;rdquo; était significativement plus élevé que le &amp;ldquo;taux d&amp;rsquo;admission des femmes (35%)&amp;rdquo;, soulevant ainsi un problème de discrimination évidente envers les femmes.
Cependant, en divisant et en analysant finement les données &amp;ldquo;par département&amp;rdquo;, un fait surprenant a été révélé.
Dans presque tous les départements, &lt;strong>le taux d&amp;rsquo;admission des femmes était plus élevé que celui des hommes&lt;/strong>.&lt;/p>
&lt;p>Pourquoi les chiffres globaux se sont-ils inversés ?
En réalité, les femmes postulaient principalement à des &amp;ldquo;départements ayant un faible taux d&amp;rsquo;admission (très sélectifs)&amp;rdquo;, tandis que les hommes postulaient principalement à des &amp;ldquo;départements ayant un taux d&amp;rsquo;admission élevé (faciles d&amp;rsquo;accès)&amp;rdquo;.&lt;/p>
&lt;h3 id="données-sur-lefficacité-du-vaccin-contre-le-covid">Données sur l&amp;rsquo;efficacité du vaccin contre le COVID
&lt;/h3>&lt;p>Des données indiquant que &amp;ldquo;les personnes vaccinées ont un taux de mortalité plus élevé que les personnes non vaccinées&amp;rdquo; ont circulé et provoqué un tollé.
Ceci est également le résultat d&amp;rsquo;avoir ignoré les données par tranche d&amp;rsquo;âge (la variable cachée).
Les vaccins ayant été administrés en priorité aux &amp;ldquo;personnes âgées (qui ont déjà un taux de mortalité plus élevé de base)&amp;rdquo;, en cumulant simplement les taux de mortalité globaux, le groupe des personnes vaccinées s&amp;rsquo;est retrouvé avec une proportion extrême de personnes âgées, donnant l&amp;rsquo;apparence d&amp;rsquo;un taux de mortalité plus élevé.&lt;/p>
&lt;p>En comparant par tranches d&amp;rsquo;âge, il a été confirmé que dans toutes les tranches d&amp;rsquo;âge, &amp;ldquo;les personnes vaccinées ont un taux de mortalité plus faible&amp;rdquo;.&lt;/p>
&lt;hr>
&lt;h2 id="5-conclusion--les-données-ne-mentent-pas-mais-les-gens-peuvent-mentir-avec-les-données">5. Conclusion : Les données ne mentent pas, mais les gens peuvent mentir avec les données
&lt;/h2>&lt;p>Le paradoxe de Simpson nous avertit du &lt;strong>&amp;ldquo;danger de juger uniquement en regardant les données globales, comme les moyennes ou les totaux&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;p>Le monde regorge d&amp;rsquo;entreprises, de politiciens et de médias qui ne retiennent que les &amp;ldquo;chiffres globaux&amp;rdquo; pour les mettre en avant de la manière qui les arrange.
Même si l&amp;rsquo;on vous dit : &amp;ldquo;Notre produit A a une satisfaction globale supérieure au produit concurrent B !&amp;rdquo;, si l&amp;rsquo;on sépare les données entre les &amp;ldquo;jeunes&amp;rdquo; et les &amp;ldquo;personnes âgées&amp;rdquo;, il est fort possible que le produit B soit gagnant dans les deux catégories.&lt;/p>
&lt;p>Lorsque vous regardez des données, la meilleure arme pour survivre dans la société de l&amp;rsquo;information d&amp;rsquo;aujourd&amp;rsquo;hui est de ne pas se laisser tromper par les chiffres &amp;ldquo;globaux&amp;rdquo; en surface, et de toujours garder un esprit critique : &amp;ldquo;N&amp;rsquo;y a-t-il pas un déséquilibre extrême dans la proportion des groupes à cause de variables cachées en arrière-plan (âge, sexe, gravité, etc.) ?&amp;rdquo;.&lt;/p></description></item></channel></rss>