<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>囚徒困境 on kenji.blog</title><link>http://kenji.blog/zh-cn/tags/%E5%9B%9A%E5%BE%92%E5%9B%B0%E5%A2%83/</link><description>Recent content in 囚徒困境 on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><copyright>kenjinote</copyright><lastBuildDate>Thu, 10 Sep 2026 03:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/zh-cn/tags/%E5%9B%9A%E5%BE%92%E5%9B%B0%E5%A2%83/index.xml" rel="self" type="application/rss+xml"/><item><title>囚徒困境：为什么我们会做出“两败俱伤”的选择？</title><link>http://kenji.blog/zh-cn/p/prisoners-dilemma/</link><pubDate>Thu, 10 Sep 2026 03:00:00 +0900</pubDate><guid>http://kenji.blog/zh-cn/p/prisoners-dilemma/</guid><description>&lt;img src="http://kenji.blog/p/prisoners-dilemma/img/prisoners_dilemma.jpg" alt="Featured image of post 囚徒困境：为什么我们会做出“两败俱伤”的选择？" />&lt;h2 id="1-终极选择保持沉默还是背叛">1. 终极选择：保持沉默，还是背叛？
&lt;/h2>&lt;p>你和共犯朋友因为涉嫌某项犯罪被警察抓获。
两人被分别关在不同的审讯室里，彼此之间完全无法联系。&lt;/p>
&lt;p>由于警方没有掌握充分的证据，检察官分别向你和朋友提出了如下的“认罪协商”：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>如果双方都“保持沉默（合作）”：&lt;/strong> 因证据不足，两人都只需判 &lt;strong>1年监禁&lt;/strong>。&lt;/li>
&lt;li>&lt;strong>如果你“招供（背叛）”，而朋友“保持沉默”：&lt;/strong> 配合调查的你将 &lt;strong>无罪（立即释放）&lt;/strong>，而朋友将承担所有罪名被判 &lt;strong>10年监禁&lt;/strong>。（反之亦然）&lt;/li>
&lt;li>&lt;strong>如果双方都“招供（背叛）”：&lt;/strong> 因为两人都认罪了，稍微减轻刑罚，两人都被判 &lt;strong>5年监禁&lt;/strong>。&lt;/li>
&lt;/ol>
&lt;p>那么，你会怎么做？是选择“保持沉默（与对方合作）”？还是选择“招供（背叛对方）”？&lt;/p>
&lt;hr>
&lt;h2 id="2-收益矩阵分析">2. 收益矩阵分析
&lt;/h2>&lt;p>让我们把这种情况整理成博弈论中使用的“收益矩阵”。
表格中的数字代表了（你的监禁年数, 朋友的监禁年数）。负数表示损失（监禁年数）。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th style="text-align:left">你 \ 朋友&lt;/th>
&lt;th style="text-align:center">保持沉默（合作）&lt;/th>
&lt;th style="text-align:center">招供（背叛）&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td style="text-align:left">&lt;strong>保持沉默（合作）&lt;/strong>&lt;/td>
&lt;td style="text-align:center">(-1, -1)&lt;/td>
&lt;td style="text-align:center">(-10, 0)&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td style="text-align:left">&lt;strong>招供（背叛）&lt;/strong>&lt;/td>
&lt;td style="text-align:center">(0, -10)&lt;/td>
&lt;td style="text-align:center">(-5, -5)&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>客观来看，两人应该采取的最佳行动显而易见。
&lt;strong>如果两人都“保持沉默”，总刑期只有2年（-1和-1）。&lt;/strong> 这是使整体利益最大化的“帕累托最优”状态。&lt;/p>
&lt;p>然而，如果你是一个“试图使自身利益最大化的理性人”，得出的结论将截然不同。&lt;/p>
&lt;hr>
&lt;h2 id="3-为什么背叛会成为理性的选择">3. 为什么“背叛”会成为理性的选择？
&lt;/h2>&lt;p>让我们试着预测身处另一房间的“朋友”的行动，来追踪你决定自己行动的思考过程。&lt;/p>
&lt;p>&lt;strong>情况1：预测朋友会“保持沉默”时&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>如果自己也“保持沉默”，判刑1年。&lt;/li>
&lt;li>如果自己“招供”，无罪（立即释放）。
$\rightarrow$ 因为无罪更好，所以**“招供（背叛）”**是最佳选择。&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>情况2：预测朋友会“招供”时&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>如果自己“保持沉默”，判刑10年。&lt;/li>
&lt;li>如果自己“招供”，判刑5年。
$\rightarrow$ 因为判5年更好受些，所以依然是**“招供（背叛）”**为最佳选择。&lt;/li>
&lt;/ul>
&lt;p>你发现了吗？无论对方采取什么行动，&lt;strong>对你来说“招供（背叛）”总是更有利的&lt;/strong>。
这在博弈论中被称为**“占优策略”**。&lt;/p>
&lt;p>你的朋友也处于完全相同的境地，也会进行同样理性的思考，因此对朋友来说“招供”也是占优策略。&lt;/p>
&lt;p>结果就是，经过理性思考的两人，必然都会选择互相“招供（背叛）”。
导致的结果是，最终两人 &lt;strong>都被判5年监禁（-5, -5）&lt;/strong>，从整体来看这是一个接近最糟糕的结局。如果两人合作（保持沉默）本来只需判刑1年，但追求个人理性的结果却是两败俱伤。&lt;/p>
&lt;div class="mermaid">graph TD
Start["选择开始"] --> Logic_You["你的理性思考"]
Start --> Logic_Friend["朋友的理性思考"]
Logic_You -->|如果对方沉默，招供有利&lt;br>如果对方招供，也是招供有利| Betray_You["你选择招供(背叛)"]
Logic_Friend -->|如果对方沉默，招供有利&lt;br>如果对方招供，也是招供有利| Betray_Friend["朋友选择招供(背叛)"]
Betray_You --> Result["结果：双方招供 (-5, -5)"]
Betray_Friend --> Result
Ideal["理想：双方沉默 (-1, -1)"] -.->|个人理性作祟&lt;br>无法达到| Result
style Result fill:#ff9999,stroke:#333,stroke-width:2px
style Ideal fill:#99ff99,stroke:#333,stroke-width:2px&lt;/div>
&lt;p>这种“在互相预测了对方的行动后，双方都没有动机改变自己策略（无可奈何）的状态”，以博弈论大师约翰·纳什的名字命名，被称为**“纳什均衡”**。&lt;/p>
&lt;p>囚徒困境最可怕的一点在于，&lt;strong>“帕累托最优（对整体最好的结果）”和“纳什均衡（个人理性的最终归宿）”并不一致&lt;/strong>。&lt;/p>
&lt;hr>
&lt;h2 id="4-潜藏在日常社会中的囚徒困境">4. 潜藏在日常社会中的“囚徒困境”
&lt;/h2>&lt;p>囚徒困境不仅仅是一个智力测验。我们社会中发生的许多问题都可以用这个数学模型来解释。&lt;/p>
&lt;h3 id="1-价格战降价竞争">1. 价格战（降价竞争）
&lt;/h3>&lt;p>两家竞争对手企业以1000元的价格销售类似的产品。
如果双方都保持1000元（合作），两家都能获得高额利润。
然而，抵挡不住“比对方稍微便宜一点（背叛）来垄断客户”的诱惑，两家公司开始了价格战。结果产品变成了500元，两家公司都无利可图，陷入困境（双方背叛）。&lt;/p>
&lt;h3 id="2-环境问题与温室气体">2. 环境问题与温室气体
&lt;/h3>&lt;p>世界各国承诺“减少二氧化碳排放（合作）”。这是对整个地球的最优解。
但是，如果只有本国“无视排放限制继续运营工厂（背叛）”，就能让本国经济快速增长。反之，如果其他国家背叛了而只有本国遵守规则，本国在经济上就会遭受巨大损失。
结果，每个国家都因为害怕吃亏而选择背叛，地球环境不断遭到破坏。&lt;/p>
&lt;h3 id="3-体育界的兴奋剂问题">3. 体育界的兴奋剂问题
&lt;/h3>&lt;p>理想情况是所有运动员都不使用兴奋剂（合作）。
但是，出于“对手可能在使用兴奋剂”的疑神疑鬼，以及“只要自己用了就能赢”的诱惑，最终选择了使用兴奋剂（背叛）。结果陷入了所有人都在损害健康、依靠药物比赛的最糟糕局面。&lt;/p>
&lt;hr>
&lt;h2 id="5-有解决办法吗一报还一报策略">5. 有解决办法吗？“一报还一报策略”
&lt;/h2>&lt;p>在单次交易中，“背叛”总是理性的选择。
然而，如果变成了“与同一对手多次重复的博弈（重复囚徒困境）”，情况就会发生戏剧性的变化。&lt;/p>
&lt;p>20世纪80年代，政治学家罗伯特·阿克塞尔罗德举办了一场计算机锦标赛，让编有各种策略的程序进行对战。
在世界各地学者提交的“总是背叛”、“随机背叛”、“宽恕对方”等复杂策略中，以压倒性成绩获得冠军的，是最简单的**“一报还一报策略（Tit for Tat）”**。&lt;/p>
&lt;p>一报还一报策略的规则仅此而已：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>第一次必须“合作”。&lt;/strong>&lt;/li>
&lt;li>&lt;strong>从第二次起，直接模仿上一次“对方采取的行动”。&lt;/strong>
&lt;ul>
&lt;li>如果对方上一次合作了，这次我也合作。&lt;/li>
&lt;li>如果对方上一次背叛了，这次我也背叛并进行报复。&lt;/li>
&lt;/ul>
&lt;/li>
&lt;/ol>
&lt;p>这个策略之所以强大，是因为它具备了4个特点：“绝对不主动背叛（善良）”、“遭到背叛立即惩罚（严厉）”、“对方改过自新立刻原谅（宽容）”、“结构简单容易让对方理解（明了）”。&lt;/p>
&lt;div class="mermaid">graph LR
Start["第1次：无条件合作"] --> Round2
Round2["观察对方行动"] -->|对方合作了| Act_Coop["自己也合作"]
Round2 -->|对方背叛了| Act_Betray["自己也背叛 (报复)"]
Act_Coop --> Round2
Act_Betray -->|对方反省并&lt;br>恢复合作的话| Act_Coop&lt;/div>
&lt;p>在人际关系和国际社会中也是如此，只要以长期关系为前提，通过共享像“一报还一报策略”那样**“基本以合作为主，但对背叛给予惩罚”**的规则，就能克服囚徒困境，建立起合作关系。&lt;/p>
&lt;h2 id="6-总结数学告诉我们信任的价值">6. 总结：数学告诉我们“信任”的价值
&lt;/h2>&lt;p>囚徒困境用数学证明了，“人类利己的理性”有时会将整个社会推入不幸的深渊。
“只想自己占便宜”或者“不想被别人算计”的个人理性，最终会导致作茧自缚的结果（纳什均衡）。&lt;/p>
&lt;p>但同时，博弈论也告诉我们，只要具备“关系长期持续”这一条件，&lt;strong>“互相信任与合作”才是最终能使自身利益最大化的最合理的策略&lt;/strong>。&lt;/p>
&lt;p>当你下次犹豫“要不要就自己稍微耍点小聪明”时，不妨回想一下这个囚徒困境的收益矩阵。因为追求眼前利益的“理性背叛”，从长远来看也许是最不理性的选择。&lt;/p></description></item></channel></rss>