數學傳播
logo-數學傳播

數學傳播
logo_m-數學傳播

    跳至中央區塊/Main Content :::
  • 歷年季刊
  • 季刊公告
    • 稿約
    • 訂閱資訊
    • 勘誤
    • 數播線上
  • 專訪
  • 聯絡我們
EN
search
  • Home
  • 歷年季刊
  • Vol.50 No. 3
  • Facebook
  • line
  • email
  • Twitter
  • Print
2026年9月 50卷3期
黑暗森林、猜疑鏈與賽局理論
發刊日期
2026年9月
標題
黑暗森林、猜疑鏈與賽局理論
作者
海上
關鍵字
賽局理論, 數理邏輯, 機率論
檔案下載
Download PDF
全文

摘要: 《三體》中的「黑暗森林法則」與「猜疑鏈」給我們展現了獨特的宇宙社會學想像。 在這篇文章中, 我們將結合賽局理論 (Game Theory) 與認知邏輯 (Epistemic Logic), 探討這些科幻概念背後的數學原理。 小說中的理論不一定就是宇宙的真實面貌, 但是藉由這個引人入勝的科幻設定作為例子, 可以向大家科普賽局理論中的公共知識與通訊難題。

1. 簡介

《三體》是科幻作家劉慈欣創作的科幻小説 ###。 這部作品不僅獲得了科幻界最高榮譽「雨果獎」, 更被翻譯成數十種語言在全球暢銷, 並受到包含美國前總統歐巴馬等國際知名人士的高度評價, 可以說是具有世界級影響力的中文作品。

作者提出了一個震撼的宇宙假說 ⸺ 「黑暗森林法則」 #。 這個法則試圖從理性與生存的角度, 解釋為什麼宇宙中明明可能存在無數的文明, 但我們卻遲遲無法接收到任何外星智慧生物的訊號。

這套宇宙社會學理論的核心, 建立在兩條基本公理之上:

1. 第一公理: 生存是文明的第一需要。
2. 第二公理: 文明不斷增長和擴張, 但宇宙中的物質總量保持不變。

在這兩條公理的框架下, 再加上兩個至關重要的衍生概念 ⸺ 「猜疑鏈」與「技術爆炸」, 當兩個文明在宇宙中相遇, 由於光速壁壘所帶來的巨大距離障礙, 雙方無法建立即時的溝通與信任, 從而陷入了「你是善意還是惡意」、 「你認為我是善意還是惡意」的無限邏輯猜忌中。 與此同時, 任何一個弱小的文明都有可能在短時間內發生「技術爆炸」, 從而超越並威脅到原本強大的文明。

因此, 小說中將宇宙描繪成一座黑暗森林, 每個文明都是帶槍的獵人。 在這片森林中, 他人就是永恆的威脅, 任何暴露自己存在的文明都將在瞬間遭到清理。

我接觸到賽局理論和認知邏輯時, 回想起最早接觸到「黑暗森林法則」與「猜疑鏈」時的感受。 「光速壁壘」、 「技術爆炸」、 「猜疑鏈」, 這些概念當時都極大地衝擊了我的經典宇宙觀。

客觀來說, 劉慈欣的理論並不一定就是宇宙真實的運作法則。 他是在對科幻、 社會學, 和宇宙思考的基礎上, 為文明互動建構出一個殘酷的模型。 我們寫這篇文章, 重點不是要證明這個理論在現實中絕對正確, 而是希望能藉由《三體》這個廣為人知的例子, 為大家科普賽局理論與邏輯學的相關知識。

賽局理論 (Game Theory) 在上世紀由馮·紐曼 (John von Neumann) 開始 #, 歷經納許 (John Nash) #, 到托馬斯 $\cdot$ 謝林 (Thomas Schelling) # 與羅伯特 $\cdot$ 奧曼 (Robert Aumann) # 等等學者, 已經有了長足的發展。 特別是謝林, 對於這類威懾與溝通的話題有過許多探討。 本文將藉由《三體》的科幻設定, 為大家介紹: 「公共知識」、 Halpern-Moses 的認知邏輯系統、 賽局理論中的 Rubinstein 電子郵件賽局模型, 以及 Monderer-Samet 的「機率信念放寬」理論。

以下是對《三體》中「黑暗森林法則」的一種可能的解釋與數學建模, 以及基於賽局理論與認知邏輯的推導。

2. 宇宙: 一個存在通訊摩擦的非同步系統

要探討信任與猜疑, 我們先對通訊環境建立一個模型。 在此, 我們必須先介紹「公共知識」(Common Knowledge) 這個概念。

「公共知識」由哲學家大衛·路易斯 (David Lewis) 在他的博士論文《對慣例的哲學分析》(Convention: A Philosophical Study) 中首次提出 #, 隨後被賽局理論、 經濟學與計算機科學廣泛應用。 這充分展現了各個學科之間的交織和相互推進。 (另一個類似的經典範例是「互模擬」 (bisimulation) 的概念, 它也是在模態邏輯與計算機科學中, 被兩個領域的學者分別獨立提出來的。)

在邏輯學中, 「公共知識」指的是:不僅我知道, 你知道, 我還知道「你知道我知道」 $\cdots$ 以此類推達到無限階的狀態。

為了更直觀地理解這個概念, 我們可以用十字路口的「紅綠燈」來做一個生活中的例子。

假設兩位駕駛員 A 與 B 在沒有視野死角的十字路口相遇, A 的方向亮起了綠燈, B 的方向亮起了紅燈 (我們將「A 擁有通行權」記為命題 $\varphi$) 。

$\bullet$ 如果僅僅是 A 知道自己是綠燈 (一階知識), A 敢直接踩油門嗎? 不敢。 因為 A 必須確定 B 也看到了紅燈。
$\bullet$ 如果 A 知道「B 知道自己是紅燈」 (二階知識), 這就夠了嗎? 依然有風險。 如果 B 雖然看到了紅燈, 但 B 以為 A 沒看到綠燈, B 可能會猜測 A 會猶豫不敢走, 因而 B 自己搶先衝出路口。
$\bullet$ 為了絕對安全, A 必須知道「B 知道『A 知道 B 是紅燈』」 $\cdots$這個博弈邏輯會沒完沒了。

在人類社會中, 十字路口之所以不會天天發生車禍, 是因為高懸在半空中的紅綠燈是一個絕對的「公開訊號」。 當紅綠燈亮起時, 它不僅發布了資訊, 還瞬間在所有駕駛員腦中建立了一種無限遞迴的共識: 我知道我是綠燈, 我也知道你是紅燈, 我也知道你知道我是綠燈 $\cdots$這就是公共知識 $C(\varphi)$ 在起作用。

我們可以引用一段對於「猜疑鏈」的闡述:

「如果你認為我是善意的, 這並不是你感到安全的理由, 因為按照第一條公理, 善意文明並不能預先把別的文明也想成善意的, 所以, 你現在還不知道我是怎麼認為你的, 你不知道我認為你是善意還是惡意; 進一步, 即使你知道我把你也想像成善意的, 我也知道你把我想像成善意的, 但是我不知道你是怎麼想我怎麼想你怎麼想我的, 挺繞的是不是? 這才是第三層, 這個邏輯可以一直向前延伸, 沒完沒了。 」#[p.466]

可以看到, 《三體》中的「猜疑鏈」, 本質上就是說「公共知識」(Common Knowledge) 無法達成。

在經濟學理論、 理論計算機科學、 語言學和哲學領域中, 長期以來都存在著一個傳統觀點: 人們在許多情況下, 對「公共知識」或「公共信念」都有著某種程度的近似。 例如, 當他們正一起看著同一個物體時, 或者當他們剛剛在對話中明確討論過某個話題時。

但在宇宙通訊中, 「公共知識」的建立卻受到了物理學規律的嚴格限制。 狹義相對論告訴我們, 光速是資訊傳遞的上限, 任何訊息都不可能瞬間到達。 這意味著文明間的通訊, 符合計算機科學中「非同步分散式系統」(Asynchronous Distributed System) 的兩個基本限制:

1. 延遲無絕對上限: 由於光速 $c$ 的限制與相對運動, 資訊傳輸的延遲 $\Delta t$ 很大且不穩定。
2. 資訊遺失機率 $\epsilon \gt 0$: 宇宙塵埃或技術故障, 使得任何一次訊號發送都有一個大於零的機率 $\epsilon$ 無法被對方正確接收。

1990 年, 計算機科學家 Joseph Halpern 和 Yoram Moses 提出了一個著名的定理 #。 他們證明: 在任何存在微弱通訊摩擦 ($\epsilon \gt 0$) 的系統中, 嚴格的 「公共知識」 是無法達成的。 為了理解這個反直覺的結論, 我們需要先建立認知邏輯的語意。

假設宇宙中存在 $n$ 個獨立的文明, 我們將其標記為集合 $P = \{1, 2, \dots, n\}$。 時間則是離散的 $t \in \mathbb{N}$。

宇宙的演化是一個完整的歷史。 我們定義一個執行過程 (Run) $r$ 為宇宙從時間 $0$ 到無窮遠的歷史發展。 我們稱特定的歷史與時間的組合 $(r, t)$ 為一個「點」(Point), 代表宇宙在某一時刻的可能世界。

在點 $(r, t)$, 文明 $i$ 所能觀測到的所有資訊 (包含自身的歷史、 收到的所有訊號) 構成了它的局部狀態 (Local State), 記為 $r_i(t)$。

由於光速壁壘和資訊遺失, 文明 $i$ 無法掌握宇宙的全貌。

定義2.1 (不可區分). 對於文明 $i$, 如果它在點 $(r, t)$ 的局部狀態與在點 $(r', t')$ 的局部狀態完全相同, 即:

$$r_i(t) = r_i'(t'),$$

則我們稱這兩個點對文明 $i$ 是不可區分的, 記作:

$$(r, t) \sim_i (r', t').$$

因為等式具有反身性、 對稱性和遞移性, 關係 $\sim_i$ 是一個等價關係 (Equivalence Relation)。 這個等價關係將全宇宙中所有可能的世界點集劃分成一個個獨立的 「連通分支」 (Connected Component)。 在同一個連通分支內, 所有的可能世界對文明 $i$ 而言, 在觀測數據上都是完全一樣的。 這就意味著, 文明 $i$ 根本無法僅憑眼前的數據, 來判斷自己究竟身處於這個分支中的哪一個具體世界。

假設 $\varphi$ 為一個命題, 例如「對方文明是善意的」。 我們記 $(r, t) \models \varphi$ 表示命題 $\varphi$ 在點 $(r, t)$ 處為真。

定義2.2 (知識算子 $K_i$). 文明 $i$ 在點 $(r, t)$ 「知道」命題 $\varphi$ 為真, 記作 $(r, t) \models K_i(\varphi)$, 若且唯若對於所有與 $(r, t)$ 不可區分的可能世界, $\varphi$ 均成立。 即:

$$(r, t) \models K_i(\varphi) \Longleftrightarrow \forall (r', t') \text{ 滿足 } (r, t) \sim_i (r', t'), \text{ 有 } (r', t') \models \varphi.$$

簡單來說: 只有當所有與當前狀態不可區分、 且在認知上可通達的可能世界中, 命題 $\varphi$ 全都保持為真時, 主體才算是真正「知道」該命題。

為了定義公共知識, 我們需要先定義高階的相互知識 $E^m(\varphi)$。 一階相互知識 (Mutual Knowledge) 定義為「大家都知道 $\varphi$」:

$$E^1(\varphi) = \bigcap_{i \in P} K_i(\varphi).$$

直觀來說, 這代表集合 $P$ 中的每一個體都具備了關於 $\varphi$ 的知識。 但這還不足以形成共識, 因為我可能知道這件事, 但我不知道「你也知道」。

高階相互知識:

$$E^{m+1}(\varphi) = E^1(E^m(\varphi))$$

意味著不僅每個人都知道 $\varphi$, 大家也都知道「其他人都知道 $\varphi$」 (第二階), 甚至知道「大家都知道『大家都知道 $\varphi$』」 (第三階), 以此類推。

公共知識算子 $C(\varphi)$ 則是將這個狀態疊代無窮次, 即:

$$C(\varphi) = \bigcap_{m=1}^{\infty} E^m(\varphi).$$

針對這, Halpern 和 Moses 給出了一個關鍵的引理。

引理 2.1 (可達性引理 Reachability Lemma). 只要點 $(r', t')$ 與點 $(r, t)$ 屬於同一個連通分支, 達成公共知識就要求該分支內所有的點皆使命題為真。 亦即:

$$(r, t) \models C(\varphi) \Longleftrightarrow \forall (r', t') \text{ 屬於同一連通分支, 均有 } (r', t') \models \varphi$$

證明: 我們使用數學歸納法證明: $(r, t) \models E^m(\varphi)$ 若且唯若對於任意通過一條長度為 $m$ 的 $\sim_i$ 路徑連接到的點 $p_m$, 都有 $p_m \models \varphi$。

基礎情況 ($m=1$)
$(r, t) \models E^1(\varphi)$ 意味著對所有 $i \in P$, $(r, t) \models K_i(\varphi)$。 根據定義 2.2, 這等價於: 對於所有距離起點為 1 跳的點 $p_1$ (即存在 $i$ 使 $(r, t) \sim_i p_1$), 都有 $p_1 \models \varphi$。 基礎情況成立。

歸納假設: 假設定理對路徑長度 $m \!=\! k$ 成立。 即從起點經過任意 $k$ 條邊可達的點, 命題均為真。

推斷步驟 ($m=k+1$)

根據定義, $(r, t) \models E^{k+1}(\varphi)$ 等價於 $(r, t) \models E^1(E^k(\varphi))$。

由基礎情況可知, 這等價於:對於所有距離起點 1 跳的點 $p_1$, 都有 $p_1 \models E^k(\varphi)$。

再運用歸納假設, $p_1 \models E^k(\varphi)$ 等價於:從 $p_1$ 出發, 經過 $k$ 條邊可達的所有點 $p_{k+1}$, 都有 $p_{k+1} \models \varphi$。

將這兩段路徑拼接:從起點走 1 跳到 $p_1$, 再從 $p_1$ 走 $k$ 跳到 $p_{k+1}$, 恰好構成了從起點出發長度為 $k+1$ 的全集。

因此, 無限階的 $C(\varphi)$ 要求走訪距離為 $1, 2, \dots, \infty$ 的所有點。 引理 2.1 證畢。

$\Box$

回到小說的情境, 假設地球收到了一條善意訊號。 但這其實對應了兩個不可區分的可能世界:

$\bullet$ 點 $p_1$:對方確實是善意的, 訊號經過數年到達。
$\bullet$ 點 $p_2$:對方是惡意的, 並在數年前發出了誘餌訊號。

在我們的認知空間中, 這兩點被連通在一起。 只要宇宙中存在遺失訊號的機率 $\epsilon$, 這個連通分支就永遠無法確保全為「善意」。 只要分支中存在哪怕一個點 (如 $p_2$) 使得 $\varphi$ 為假, 引理 2.1 就會判定:

$$C(\varphi) \equiv \emptyset.$$

在光速受限的物理法則下, 任何兩個通訊端之間都很難建立起關於「善意」的絕對公共知識。 猜疑鏈在數學模型上, 是一條無法跨越的鴻溝。

3. 黑暗森林賽局

受限於光速壁壘與通訊摩擦, 文明之間絕對不可能建立起關於「善意」的嚴格公共知識。 但是, 沒有絕對的公共知識, 就一定會導致互相毀滅嗎? 在人類社會中, 我們經常在缺乏 100% 信任的情況下達成合作。 為什麼宇宙中不行?

為了解答這個問題, 並嚴謹推向黑暗森林法則, 我們必須引入「不完全資訊賽局」(Incomplete Information Game)。 我們將利用 Ariel Rubinstein 在 1989 年提出的經典「電子郵件賽局」(Electronic Mail Game) 模型 #, 結合小說中「技術爆炸」的客觀設定, 運用貝氏定理 (Bayes' Theorem) 推導出黑暗森林唯一的納許均衡 (Nash Equilibrium)。

假設宇宙中存在兩個文明:文明 1 與文明 2。 他們面臨兩種策略選擇:

$\bullet$ 行動 A (攻擊/靜默): 隱藏自己, 一旦發現目標立刻進行毀滅性打擊。
$\bullet$ 行動 B (暴露/和平): 主動暴露自身座標, 發射和平溝通訊號。

大自然決定了宇宙的客觀環境, 分為兩種狀態:

$\bullet$ 狀態 $a$ (險惡狀態): 宇宙資源枯竭, 本不具備共存基礎。 此狀態出現的先驗機率為 $1-p_0$。
$\bullet$ 狀態 $b$ (和平潛力):存在資源冗餘, 雙方有和平共榮的潛力。 此狀態出現的先驗機率為 $p_0$。 我們假定和平極為罕見, 即 $p_0 \lt 0.5$。

狀態 $b$ (和平潛力) 的收益矩陣 (Payoff Matrix)是:

參數 $M \gt 0$ 代表生存的收益或和平的紅利。 參數 $-L$ 則是黑暗森林理論的核心所在。 如果一方選擇暴露座標 (B), 另一方選擇打擊 (A), 暴露方將面臨絕對的毀滅。 由於宇宙中存在「技術爆炸」的客觀規律, 你無法保證對方不會在短時間內技術超越並抹殺你。 因此, 遭到單方面打擊的損失是無窮大的。 這表現為這個約束:

$$ L \gg M \gt 0 .$$

假設宇宙當前實際上處於狀態 $b$ (雙方確實可以和平共處), 且文明 1 向文明 2 發送了善意訊號。 由於存在通訊摩擦, 每次訊號傳輸有 $\epsilon \gt 0$ 的機率遺失。 收到訊號的一方會自動向另一方回傳確認訊號, 如此往復。

設 $t_i$ 為文明 $i$ 記錄的、 其發出的確認訊號總次數。 當文明 1 看到自己發送了 $k$ 次訊號 ($t_1=k \ge 1$) 時, 真實狀態只可能是以下兩種之一:

1. 最後一次訊號遺失: 文明 1 發給文明 2 的第 $2k-1$ 次訊號遺失了。 此時文明 2 只發送了 $k-1$ 次訊號, 全域狀態記為 $(b, k, k-1)$。 其發生的機率為 $p_0(1-\epsilon)^{2k-2}\epsilon$。
2. 對方的確認訊號遺失: 文明 2 收到了訊號, 並發回第 $2k$ 次確認, 但該確認遺失了。 此時文明 2 發送了 $k$ 次訊號, 全域狀態記為 $(b, k, k)$。 其發生的機率為 $p_0(1-\epsilon)^{2k-1}\epsilon$。

文明 1 作為一個理性的賽局方, 運用貝氏定理來推測文明 2 的狀態。 他評估「對方沒有收到自己最後一次確認訊號」 (即 $t_2=k-1$) 的後驗機率為:

$$ P(t_2=k-1 \mid t_1=k) = \frac{P(b, k, k-1)}{P(b, k, k-1) + P(b, k, k)}. $$

將先驗機率嚴格代入:

$$ P(t_2=k-1 \mid t_1=k) = \frac{p_0\epsilon(1-\epsilon)^{2k-2}}{p_0\epsilon(1-\epsilon)^{2k-2} + p_0\epsilon(1-\epsilon)^{2k-1}}. $$

提出並約去分子分母的公因式 $p_0\epsilon(1-\epsilon)^{2k-2}$, 得到:

$$ P(t_2=k-1 \mid t_1=k) = \frac{1}{1 + (1-\epsilon)} = \frac{1}{2-\epsilon} .$$

由於宇宙存在絕對的通訊摩擦 ($\epsilon \in (0, 1)$), 這導致代數上必然有 $2-\epsilon \lt 2$。 因此我們得到不等式:

$$ \frac{1}{2-\epsilon} \gt \frac{1}{2}. $$

這就是黑暗森林猜疑鏈在數學上的冷酷斷定:這個機率解與 $k$ 完全無關!這意味著, 無論兩個文明之間交換了多少次「我是善意」的訊號, 哪怕系統成功確認了一萬次 ($k=10000$), 在最後一條訊號發出後, 發送方始終認為「對方沒有收到最後這條確認訊號」的機率, 嚴格大於 50%。

在明確了大於 50% 的猜疑底線後, 我們運用嚴格的數學歸納法證明:在上述收益矩陣與貝氏信念下, 雙方必然全部選擇行動 A (攻擊), 這構成了宇宙唯一的納許均衡。

設文明 $i$ 的策略函數為 $s_i(t_i) \in \{A, B\}$。

考察文明 1 在 $t_1=0$ 時的決策。 若未收到任何訊號, 文明 1 確切知道宇宙處於險惡狀態 $a$。 在狀態 $a$ 中, 選擇 B 會有 $-L$ 或 $0$ 的收益;選擇 A 會有 $M$ 或 $0$ 的收益。 為了規避絕對的生存毀滅 $-L$, 理性文明必須選擇 A。 因此, 必然有 $s_1(0)=A$。

考察文明 2 在 $t_2=0$ 時的決策。 文明 2 未收到訊號, 他計算出文明 1 同樣未發送訊號 ($t_1=0$) 的後驗信念 $z_0 \gt 0.5$ (利用 $p_0 \lt 0.5$ 可證) 。 基於第一步的推理, 文明 2 知道如果 $t_1=0$, 文明 1 必然選 A。 此時, 如果文明 2 冒險選擇暴露 (選 B), 其期望收益 $E[U_2(B)]$ 上限為:

$$ E[U_2(B)] \le z_0 \cdot (-L) + (1-z_0) \cdot M.$$

因為 $z_0 \gt 0.5$, 且存在技術爆炸導致的極端不對稱性 ($L \gg M$), 負向懲罰項 $z_0 L$ 將呈現天文數字般的量級。因此:

$$ E[U_2(B)] \ll 0.$$

為了規避超過 50% 機率的無限毀滅, 文明 2 別無選擇, 必然有 $s_2(0)=A$。

假設對於任意整數 $k-1$, 只要一方的資訊狀態為 $k-1$, 他必然選擇攻擊, 即 $s_2(k-1)=A$。 現在將視角切換到擁有極高階互動的文明 1, 此時 $t_1=k$。 這意味著他們之間已經成功進行了 $2k-1$ 次跨越星海的溝通。 根據上一節的嚴密推導, 文明 1 評估出文明 2 停留在上一狀態的機率為:

$$ P(t_2=k-1 \mid t_1=k) = z = \frac{1}{2-\epsilon} \gt 0.5.$$

根據歸納假設, 當 $t_2=k-1$ 時, 文明 2 會選 A。 如果文明 1 堅持和平 (選 B), 其面臨打擊的期望收益上限依然為:

$$ E[U_1(B)] \le z \cdot (-L) + (1-z) \cdot M .$$

由於 $z \gt 0.5$ 且 $L\gg 0$, 不等式右側依然是一個深不見底的負值, 因此 $E[U_1(B)] \ll 0$。 出於絕對理性的生存法則, 文明 1 必須立刻抹殺對方, 必然有 $s_1(k)=A$。 同理可反向證明, 對於文明 2 而言, 必然有 $s_2(k)=A$。

在包含光速延遲 ($\epsilon$) 與技術爆炸帶來的無限毀滅代價 ($-L$) 的非同步宇宙中:

$$ s_1(0)=A \implies s_2(0)=A \implies s_1(1)=A \implies \dots \implies s_i(k)=A.$$

只要生存與技術爆炸存在 ($L \gg M$), 無論兩個文明互發了多少次善意訊號, 對最後一次訊號遺失那一微小機率的恐懼, 都會引發理性的向後倒卷。 唯一的納許均衡, 就是所有文明在發現對方的瞬間, 毫不猶豫地扣下扳機。

4. 打破黑暗森林

在前一節, 我們利用 Rubinstein 的電子郵件賽局與貝氏法則, 推導出了一個令人窒息的結論:在存在光速延遲與技術爆炸的前提下, 絕對的理性會導致猜疑鏈的向後倒卷, 使所有文明無一例外地走向黑暗森林的打擊宿命。 然而, 這套邏輯基於經典賽局理論中極其苛刻的「完全理性人」 (Rational Agent) 假設: 它要求宇宙中的文明都具備無限的認知推演算力, 在決策時絕不犯錯, 且不能容忍任何微小的次優收益。

在第二部分的模型中, 知識算子 $K_i(E)$ 是一個極端嚴苛的要求:在給定資訊集下, 事件 $E$ 必須 100% 發生。 只要存在萬分之一的訊號遺失率 ($\epsilon$), 嚴格知識的鏈條就會斷裂。

為了解決這個死結, 學者 Dov Monderer 和 Dov Samet 提出, 既然無法達到 100% 的嚴格知識, 我們應當放寬標準, 引入基於先驗機率測度 $\mu$ 的後驗信念放寬 #。

假設 $\Omega$ 為有限的狀態空間 (宇宙所有可能的世界), $\mu$ 為 $\Omega$ 上的公共先驗機率分佈, $P_i$ 為賽局方 $i$ 對狀態空間的資訊劃分 (即文明 $i$ 所能觀測到的局部狀態集合) 。

定義 4.1 ($p$-信念算子 $B_i^p$). 給定一個機率閾值 $p \in [0, 1]$, 對於任意事件 $E \subseteq \Omega$, 定義賽局方 $i$ 具有「關於 $E$ 的 $p$-信念」的狀態集合為 $B_i^p(E)$:

$$B_i^p(E) = \{\omega \in \Omega \mid \mu(E \mid P_i(\omega)) \ge p\}.$$

數學意義是, 在真實狀態 $\omega$ 下, 賽局方 $i$ 觀察到自己的資訊集 $P_i(\omega)$ 後, 透過貝氏定理計算出事件 $E$ 發生的後驗機率至少為 $p$。 顯然, 當 $p = 1$ 時, $B_i^1(E)$ 就退化為我們之前定義的嚴格知識算子 $K_i(E)$。 這種放寬允許文明在面對極微小的不確定性時, 依然能夠建立起強烈的信念。

仿照嚴格公共知識的構造, 我們建立公共 $p$-信念。

定義 4.2 (相互 $p$-信念). 定義一階相互 $p$-信念算子 $E^p(E)$, 即所有賽局方 (設共 $I$ 人) 都以至少 $p$ 的機率相信事件 $E$:

$$E^p(E) = \bigcap_{i \in I} B_i^p(E).$$

接著, 定義高階遞迴 (其中 $m \ge 2$) :

$$E^p_m(E) = E^p(E^p_{m-1}(E)).$$

定義 4.3 (公共 $p$-信念 $C^p$). 事件 $E$ 的公共 $p$-信念定義為無窮階遞迴的交集:

$$C^p(E) = \bigcap_{m=1}^{\infty} E^p_m(E).$$

在存在 $\epsilon$ 摩擦的宇宙中, 嚴格的 $C^1(E)$ 永遠為空集。 但 Monderer 與 Samet 證明了, 只要選定一個適當的 $p \lt 1$, 系統可以極快地達到 $C^p(E)$。 為了在數學上證明 $C^p(E)$ 的存在性與穩定性, 必須引入一個類似拓樸學中「閉集」(Closed Set) 的自洽結構, 使其不再需要無限向外擴張。

定義 4.4 (顯著 $p$-信念事件 Evident $p$-Belief). 稱一個事件 $F \subseteq \Omega$ 為顯著 $p$-信念事件, 若且唯若對於系統中的所有賽局方 $i \in I$, 滿足:

$$F \subseteq B_i^p(F)$$

這表示:一旦事件 $F$ 發生, 所有賽局方都必然會以至少 $p$ 的機率相信 $F$ 正在發生。 它為無限遞迴提供了一個穩固的錨點。

引理 4.1 對於任意事件 $E$, 狀態 $\omega \in C^p(E)$ 若且唯若存在一個顯著 $p$-信念事件 $F$, 使得 $\omega \in F$, 且 $F \subseteq E^p(E)$。

這個引理表明「公共 $p$-信念」不需要我們在現實中去進行無限的「我相信你相信我相信 $\cdots$」, 我們只需要找到一個「顯著事件 $F$」作為公共錨點, 即可封閉整個邏輯鏈。

為何在第三部分的 Rubinstein 賽局中, 即使信念機率達到 99.99%, 合作依然會崩潰? 根本原因在於:經典的納許均衡要求玩家的策略必須是絕對的最優反應 (Best Response)。 哪怕偏離最優反應只會造成極微小的潛在損失, 玩家也會為了規避風險而徹底改變策略, 進而引發猜疑鏈的向後倒卷。 為此, 我們必須放寬均衡的定義。

定義 4.5 ($\epsilon$-納許均衡 $\epsilon$-Nash Equilibrium). 給定一個策略組合 $s^*$, 如果對於任意賽局方 $i$ 及其任意偏離策略 $s_i$, 都滿足以下不等式:

$$E[U_i(s^*)] \ge E[U_i(s_i, s^*_{-i})] - \epsilon.$$

即, 如果單方面改變策略, 能帶來的額外收益最多不超過 $\epsilon$ (換句話說, 維持原策略只會損失一點點微不足道的潛在收益), 那麼理性的玩家就可以容忍這種微弱的不完美, 選擇維持原策略 $s^*$。

定理 4.1 (逼近定理 Approximation Theorem). 如果一個賽局在嚴格「公共知識 ($p=1$)」下存在一個納許均衡 (例如雙方共同協調選擇和平) ;那麼當系統滿足「公共 $p$-信念」且 $p$ 足夠接近 1 時, 雙方仍然選擇和平就會構成一個 $\epsilon$-納許均衡。 隨著 $p \to 1$, 容忍度 $\epsilon \to 0$。

這意味著, 如果文明能夠容忍極微小的不確定性風險, 猜疑鏈的死結在數學上是有解的。

儘管 $\epsilon$-納許均衡在理論上拯救了合作, 但《三體》設定中「技術爆炸」帶來的毀滅代價 ($-L$) 是無窮大的, 這使得常規文明依舊無法承受任何 $\epsilon$ 風險。

賽局大師羅伯特·奧曼 (Robert Aumann) 曾提出, 如果系統缺乏內生的公共知識, 我們可以引入一個外生的、 客觀的隨機訊號發生器 (Choreographer / 編舞者) 來協調各方 (Correlated Equilibrium) #。 在光速受限的宇宙中, 原本不存在這樣的第三方。

但在《三體 III:死神永生》中, 黑暗森林法則被打破了。 在《三體 III:死神永生》情節發展中, 當宇宙文明面臨熱寂的最終命運時, 高等文明「歸零者」向全宇宙發出了一項請求:要求各文明交還小宇宙內的質量, 以重啟大宇宙。 為了確保這項訊息能被所有文明準確接收, 歸零者使用了包含全宇宙文明語言的「引力波詞典」, 將通訊遺失機率 $\epsilon$ 降至零, 並讓廣播在宇宙各處同時響起 #。

從數學的角度來看, 這將通訊遺失機率 $\epsilon$ 降至零, 歸零者的介入, 構成了一個絕對的顯著事件 (Evident Event)。 先前在非同步系統中無法建立的「公共知識」, 因為這條廣播變成了絕對的事實 (即 $p=1$ 的嚴格公共知識), 猜疑鏈的貝氏遞迴在這一刻被強行終止。

宇宙的賽局性質從「獵人困境」轉變為「門檻公共物品賽局」(Threshold Public Goods Game)。

設大宇宙重啟所需的臨界總質量為 $M_{critical}$, 各個文明歸還的質量之和為 $\sum m_i$。 全新的收益函數 $U_i$ 變為:

1. 若總質量未達重啟臨界值 $M_{critical}$ ($\sum m_i \lt M_{critical}$):大宇宙將永遠膨脹下去, 熱寂意味著所有文明 (無論藏得多深, 哪怕消滅了所有對手) 的最終收益均為 $-\infty$, 即 $U_i = -\infty$。
2. 若響應號召, 如果 $\sum m_i \ge M_{critical}$,則有機會在全新宇宙中重生, 收益為正值 $R$。

在這個新的支付矩陣下, 惡意攻擊失去了戰略價值, 因為消滅對手已無法避免毀滅。 響應號召、 交還質量, 成為了各文明的唯一最佳策略。

至此, 我們介紹了第一部分中 Halpern-Moses 定理對絕對公共知識的否定;到第二部分中 Rubinstein 模型與貝氏法則推導;再到 Monderer-Samet 的機率信念放寬。

基於上述的模型與詮釋, 可以說, 《三體》不僅僅是小説三部曲, 更像是在推演一部賽局理論的演化史:《三體 I》暗示了不完全資訊與通訊延遲的環境限制。 《三體 II:黑暗森林》推演了在無政府狀態下, 猜疑鏈如何導致納許均衡的向後倒卷。 《三體 III:死神永生》則演示了機制設計 (Mechanism Design), 透過引入絕對公共訊號與重塑支付矩陣, 強行斬斷了原本無解的猜疑死結。

參考文獻

Aumann, R. J., Subjectivity and correlation in randomized strategies, Journal of Mathematical Economics, 1(1), 67-96, 1974. Aumann, R. J., Agreeing to disagree, Annals of Statistics, 4(6), 1236-1239, 1976. Halpern, J. Y. and Moses, Y., Knowledge and common knowledge in a distributed environment, Journal of the ACM (JACM), 37(3), 549-587, 1990. Lewis, D. K., Convention: A philosophical study. Cambridge: Harvard University Press, 1969. Liu, C., The three-body problem. New York: Tom Doherty Associates, LLC, 2014. Liu, C., The dark forest. New York: Tom Doherty Associates, LLC, 2015. Liu, C., Death's end. New York: Tom Doherty Associates, LLC, 2016. Monderer, D. and Samet, D., Approximating common knowledge with common beliefs, Games and Economic Behavior, 1(2), 170-190, 1989. Nash, J. F., Non-cooperative games, Annals of Mathematics, 54(2), 286-295, 1951. Rubinstein, A., The electronic mail game: Strategic behavior under "almost common knowledge", The American Economic Review, 79(3), 385-391, 1989. Schelling, T. C., The strategy of conflict. Cambridge: Harvard University Press, 1960. Von Neumann, J. and Morgenstern, O., Theory of games and economic behavior. Princeton: Princeton University Press, 1944.

本文作者曾千里投稿時就讀慕尼黑大學慕尼黑數理哲學中心 (MCMP, LMU München) (碩士班研究生)

頁碼
65-75
  • 歷年季刊
  • 季刊公告
  • 專訪
  • 聯絡我們

© Copyright 2026. Math Sinica All Rights Reserved.使用者條款、資訊安全與隱私權政策