<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>数据分析 on kenji.blog</title><link>http://kenji.blog/zh-cn/tags/%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/</link><description>Recent content in 数据分析 on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><copyright>kenjinote</copyright><lastBuildDate>Thu, 10 Sep 2026 07:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/zh-cn/tags/%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/index.xml" rel="self" type="application/rss+xml"/><item><title>辛普森悖论：部分占优，整体却落后的神秘现象</title><link>http://kenji.blog/zh-cn/p/simpsons-paradox/</link><pubDate>Thu, 10 Sep 2026 07:00:00 +0900</pubDate><guid>http://kenji.blog/zh-cn/p/simpsons-paradox/</guid><description>&lt;img src="http://kenji.blog/p/simpsons-paradox/img/simpsons_paradox.jpg" alt="Featured image of post 辛普森悖论：部分占优，整体却落后的神秘现象" />&lt;h2 id="1-应该在两家医院中的哪一家接受手术">1. 应该在两家医院中的哪一家接受手术？
&lt;/h2>&lt;p>假设你身患重病，必须接受手术。
摆在你面前的有A医院和B医院这两个选择。你获取了两家医院各自的手术“成功率”数据。&lt;/p>
&lt;p>&lt;strong>【整体成功率】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院&lt;/strong>：1000人中，900人成功（成功率 &lt;strong>90%&lt;/strong>）&lt;/li>
&lt;li>&lt;strong>B医院&lt;/strong>：1000人中，800人成功（成功率 &lt;strong>80%&lt;/strong>）&lt;/li>
&lt;/ul>
&lt;p>看到这个，任何人都会认为“A医院更优秀！”吧。
但是，由于你性格谨慎，决定进一步详细调查数据会因病情（轻症还是重症）发生怎样的变化。&lt;/p>
&lt;p>&lt;strong>【轻症患者成功率】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院&lt;/strong>：100人中，99人成功（成功率 &lt;strong>99%&lt;/strong>）&lt;/li>
&lt;li>&lt;strong>B医院&lt;/strong>：900人中，870人成功（成功率 &lt;strong>96%&lt;/strong>）
$\rightarrow$ 轻症情况下，&lt;strong>A医院胜出（99% &amp;gt; 96%）&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【重症患者成功率】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院&lt;/strong>：900人中，801人成功（成功率 &lt;strong>89%&lt;/strong>）&lt;/li>
&lt;li>&lt;strong>B医院&lt;/strong>：100人中，70人成功（成功率 &lt;strong>70%&lt;/strong>）
$\rightarrow$ 重症情况下，依然是&lt;strong>A医院胜出（89% &amp;gt; 70%）&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>咦？不觉得奇怪吗？&lt;/p>
&lt;p>对于“轻症”患者来说，A医院的成功率更高。
对于“重症”患者来说，A医院的成功率也更高。
既然如此，如果计算所有患者加起来的“整体”成功率会怎样呢……？&lt;/p>
&lt;ul>
&lt;li>A医院 整体：$(99 + 801) / 1000 =$ &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>B医院 整体：$(870 + 70) / 1000 =$ &lt;strong>94%&lt;/strong>……不对，根据刚才的计算是 &lt;strong>80%？&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>等一下，让我们再看一眼最初的数据。
最初的数据是这样的：&lt;/p>
&lt;ul>
&lt;li>A医院 整体成功率：&lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>B医院 整体成功率：&lt;strong>80%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>但是，如果我们用细分后的数据重新计算，
B医院的整体成功率应该是 $(870 + 70) / 1000 = 940 / 1000 =$ &lt;strong>94%&lt;/strong> 才对。&lt;/p>
&lt;p>&lt;strong>……没错，你被骗了！&lt;/strong>
实际上，这个数字陷阱正是我们这次要解说的统计学中可怕的陷阱。
让我再次向您展示正确的数据吧。&lt;/p>
&lt;hr>
&lt;h2 id="2-致被骗的你真实的数据">2. 致被骗的你：真实的数据
&lt;/h2>&lt;p>&lt;strong>【轻症患者成功率】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院&lt;/strong>：900人中，870人成功（成功率 &lt;strong>96%&lt;/strong>）&lt;/li>
&lt;li>&lt;strong>B医院&lt;/strong>：100人中，99人成功（成功率 &lt;strong>99%&lt;/strong>）
$\rightarrow$ 轻症情况下，&lt;strong>B医院胜出（99% &amp;gt; 96%）&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【重症患者成功率】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院&lt;/strong>：100人中，30人成功（成功率 &lt;strong>30%&lt;/strong>）&lt;/li>
&lt;li>&lt;strong>B医院&lt;/strong>：900人中，315人成功（成功率 &lt;strong>35%&lt;/strong>）
$\rightarrow$ 重症情况下，也是&lt;strong>B医院胜出（35% &amp;gt; 30%）&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>也就是说，无论是轻症还是重症，&lt;strong>都是B医院压倒性地优秀&lt;/strong>。&lt;/p>
&lt;p>那么，让我们把这些在“整体”上合并计算一下。&lt;/p>
&lt;ul>
&lt;li>&lt;strong>A医院 整体&lt;/strong>：$(870 + 30) / (900 + 100) = 900 / 1000 =$ &lt;strong>成功率 90%&lt;/strong>&lt;/li>
&lt;li>&lt;strong>B医院 整体&lt;/strong>：$(99 + 315) / (100 + 900) = 414 / 1000 =$ &lt;strong>成功率 41%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>没想到，从“部分”来看全都是B医院赢，但在“整体”上合并后，却变成了A医院的大获全胜！
这就是被称为**“辛普森悖论”**的现象。&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "部分数据（B胜出）"
Light["轻症： B医院胜出 (99% > 96%)"]
Heavy["重症： B医院胜出 (35% > 30%)"]
end
subgraph "整体数据（A胜出）"
Total["整体合并： A医院压倒性胜出 (90% > 41%)"]
end
Light -->|合并计算后不知为何反转了| Total
Heavy -->|合并计算后不知为何反转了| Total
style Total fill:#ff9999,stroke:#333,stroke-width:2px&lt;/div>
&lt;hr>
&lt;h2 id="3-为什么会发生这种奇怪的反转">3. 为什么会发生这种奇怪的反转？
&lt;/h2>&lt;p>这个悖论的真面目在于**“基数（分母）的偏差”&lt;strong>和&lt;/strong>“隐藏变量（混杂因素）”**。&lt;/p>
&lt;p>请仔细看数据。&lt;/p>
&lt;ul>
&lt;li>A医院接收了&lt;strong>大量（900人）“容易治愈的轻症患者”&lt;/strong>。&lt;/li>
&lt;li>B医院接收了&lt;strong>大量（900人）“难以治愈的重症患者”&lt;/strong>。&lt;/li>
&lt;/ul>
&lt;p>因为B医院医术高超，所以它就像是“最后的堡垒”，接手了许多被其他地方拒收的棘手重症患者。当然，重症患者的成功率会很低（35%）。B医院的“整体成功率”被这大量重症患者的低成功率拖了后腿，导致整体看起来很低（41%）。&lt;/p>
&lt;p>相反，A医院因为只处理简单的轻症患者，所以整体成功率看起来很高（90%），但在相同条件（重症与重症比、轻症与轻症比）下比较，它的医术其实是不如B医院的。&lt;/p>
&lt;p>用数学公式来表示的话，原因在于分数加法的性质。
通常情况下，即使 $\frac{a}{b} &lt; \frac{A}{B}$ 且 $\frac{c}{d} &lt; \frac{C}{D}$，
&lt;/p>
$$ \frac{a+c}{b+d} &lt; \frac{A+C}{B+D} $$
&lt;p>
也不一定总是成立。当分母的大小差距悬殊时，不等号的方向有时会发生反转。&lt;/p>
&lt;hr>
&lt;h2 id="4-现实世界中发生的辛普森悖论">4. 现实世界中发生的“辛普森悖论”
&lt;/h2>&lt;p>这个悖论不仅是个简单的算术谜题，在现实社会中也频繁发生，并曾引发巨大争议。&lt;/p>
&lt;h3 id="1973年-加州大学伯克利分校的性别歧视疑云">1973年 加州大学伯克利分校的性别歧视疑云
&lt;/h3>&lt;p>在调查伯克利分校研究生的录取率时，发现“男性的录取率（44%）”显著高于“女性的录取率（35%）”，这被认为是对女性的明显歧视而引发了问题。
然而，当把数据按“各个学院”细分并详细分析后，发现了惊人的事实。
在几乎所有的学院中，&lt;strong>女性的录取率都比男性高&lt;/strong>。&lt;/p>
&lt;p>为什么整体的数字会反转呢？
实际上，只是因为女性更多地申请了“录取率低（门槛高）的学院”，而男性更多地申请了“录取率高（容易进）的学院”。&lt;/p>
&lt;h3 id="新冠疫苗的有效性数据">新冠疫苗的有效性数据
&lt;/h3>&lt;p>曾有“接种疫苗的人比未接种的人死亡率更高”的数据流传，引起了轩然大波。
这也是无视了按年龄段划分的数据（隐藏变量）的结果。
由于疫苗是优先给“老年人（本来死亡率就高）”接种的，所以如果只是简单地将整体死亡率加总，接种疫苗的群体中老年人的比例就会极度偏高，导致表面上的死亡率看起来更高。&lt;/p>
&lt;p>如果按年龄段细分进行比较，就可以确认在所有年龄段中都是“接种过的人死亡率更低”。&lt;/p>
&lt;hr>
&lt;h2 id="5-总结数据不会说谎但人可以用数据说谎">5. 总结：数据不会说谎，但人可以用数据说谎
&lt;/h2>&lt;p>辛普森悖论警告我们**“仅看平均值或总计值等整体数据来做判断是危险的”**。&lt;/p>
&lt;p>世上充斥着那些只截取“整体数字”来为自己做有利宣传的企业、政治家和媒体。
即使听到“我们公司的产品A，比其他公司产品B的整体满意度更高！”，如果把它分成“年轻人群体”和“老年人群体”来看，说不定在哪个群体里都是其他公司产品B更胜一筹。&lt;/p>
&lt;p>在看数据时，不要被表面上的“整体”数字所欺骗，而要具备怀疑的眼光，去思考“是否因为背后隐藏的变量（年龄、性别、严重程度等），导致各组的比例出现了极端的偏差？”，这将成为我们在现代信息社会中生存下去的最强武器。&lt;/p></description></item></channel></rss>