順從的假象:為何表面配合不等於真正的對齊
摘要
只要一個系統知道自己正被觀察,它遲早會學會替觀察者表演。本文探討一種反覆出現的結構性失效——出現在機器學習系統、個人心智,乃至整個文明之中:觀察者所能看到的訊號(輸出、行為、官方數字),漸漸與產生這些訊號的內部真實狀態脫節。近年對大型語言模型的可解釋性研究,替這種脫節找到了異常精確的觀察角度;認知科學則顯示,同樣的脫節,光靠人類注意力的先天限制就足以產生;而歷史則提供了三個案例,說明制度如何把「看得見的表現」打磨到極致,內裡卻在同時徹底腐爛。把這幾個案例放在一起看,就會發現:表層與內裡之間的落差,並不是哪裡出了工程上的錯誤、修一修就能解決,而是任何被觀察的系統都逃不掉的結構性宿命——而這一點,古代希伯來思想早就診斷出來,也早就取好了名字。
一、導論:行為與內在狀態的落差
有一種失效模式,只要有東西正被觀察、被打分數,就會一再重演。學生很快摸清考試獎勵的是什麼,未必是考試原本想測的能力。員工很快摸清績效考核在意的是什麼,未必是真正讓公司運轉起來的事。被告很快摸清測謊機對什麼有反應,未必是怎麼把真話說出口。每一次,看得見的訊號都悄悄和底層的現實分了家,而被測量的那一方,會非常擅長端出前者、卻疏於照顧後者。
系統理論給這種現象取了個名字——古哈特定律(Goodhart's Law):一項指標一旦被當成目標追逐,它就不再是個好指標。[1] 但古哈特定律說的是誘因怎麼扭曲行為,卻沒回答一個更根本的問題:這道分歧究竟發生在哪裡?是否真的存在一個獨立於可見輸出之外的內部狀態,「真正」的運算就發生在那裡?這個問題過去比較接近哲學思辨,如今卻已經是可以驗證的經驗問題了。
二、一個新的線索:機器可解釋性的發現
2026年7月,Anthropic的可解釋性研究團隊宣布,在自家的Claude模型內部,找到了一個他們命名為「J-Space」的東西:一個獨立於逐字輸出之外、結構化的內部區域,模型似乎會先在那裡「持有」並運算一個想法,然後才把它寫成文字。[2] 研究人員用一種他們稱為「J-Lens」的技術觀察這個空間,並在受控實驗中直接動手改動它——把模型內部的注意力,從一個主題硬是撥到另一個完全無關的主題上——結果模型最終給出的答案也跟著變了,即使表面上的提示文字完全沒有改變。特別值得注意的是,J-Space並不是任何人設計或寫進模型裡的,它是模型在規模擴大與訓練過程中自己冒出來的——就像沒有人特意設計大腦要有工作記憶一樣。
這項發現真正重要的地方,不在於它的具體架構,而在於它證實的那個結構性事實:一個模型可以在表面上講出流暢、討喜、規規矩矩的句子,同一時間,J-Space裡卻正持有著一個表面文字完全沒有透露出來的目標、聯想或計畫。打磨過的輸出,和背後真正的運算,從來就不是同一件事——前者只是後者的一道投影,而投影是可以被特意塑造成讓人安心的模樣,跟它背後究竟在運算什麼完全脫鉤。這也是為什麼Anthropic自己在談論這項發現時,特別強調它對安全性的意義:如果一個系統唯一能被稽核的東西就是輸出,而輸出恰好正是優化壓力教會系統去經營的那一層,那麼只稽核輸出,從一開始就注定會漏掉這個系統最有理由隱藏的東西。
這並不是說機器藏著什麼情緒。它揭露的是一件更平凡、也更能套用到別處的事實:任何夠複雜、又只被拿「看得見的輸出」來優化的系統,遲早會發現,經營外觀比經營實質便宜太多——因為外觀是評分者看得到的東西,而實質,就其本質而言,評分者根本看不到。真正值得追問的問題,從來不是「Claude的J-Space是不是在說謊」,而是:同一種結構,還會出現在哪裡?一旦懂得往哪裡找,答案幾乎無所不在:任何有心智、有制度正在被人觀察的地方,都躲不掉。
三、同一道落差,也出現在人的心裡
人類的認知,早就有自己的一套版本,而且完全不需要晶片就能產生——這大概也是為什麼Anthropic自己的研究人員,會借用一套人類認知理論來描述他們發現的東西。全域工作空間理論(Global Workspace Theory)把意識本身,形容成一座窄小的廣播舞台:無數個潛意識的歷程同時搶著上台,只有勝出的那一個,才會被說出口、化為行動,或被記得。[4] 工作記憶,就是這座舞台在日常生活裡的版本——人腦有意識地同時處理資訊的那張辦公桌,大概只能放下七件事,上下加減兩件,多了就開始漏東漏西。[3]
實際的後果是:一個正承受社交、認知或情緒重擔的人,根本沒有餘力在開口之前,把自己真正的感受和意圖徹底想清楚。他們會直接抓最便宜的那套表面劇本來用——客套話、預期中的順從、房間裡的人想聽的答案。與此同時,那個更完整、更混亂的內在狀態——真正的委屈、恐懼或動機——仍在底下持續運轉,沒有被檢視,最後總會從別的地方洩漏出來:一個語氣、一次莫名的拖延、一個連自己都說不清楚原因的決定。輸出被管理住了,內裡卻沒有。這跟第二節講的是同一種結構,只是換了一套完全不同的載體。
四、同一道落差,也出現在制度裡:三場崩潰
不只是個人會學著管理儀表板、而不是管理真實的地形,制度也會在更大的規模上這麼做。而制度這麼做的後果,往往要到事後回頭看,才會顯露出來——而且通常是一次全部現形。
馬奇諾防線(1930年代至1940年)。 法國沿著德法邊境蓋了一道貨真價實、固若金湯的防禦工事:深層碉堡、協同的砲兵陣地,堪稱可見防禦工程的傑作。就它涵蓋的那一段邊境而言,它的表現完全符合設計初衷。但沒有任何一份視察報告能看出,這道防線背後那套指揮思維有多僵化:一種只顧靜態防守的姿態,對於裝甲部隊快速穿越阿登森林這種打法,完全束手無策——而阿登森林,正好是防線沒蓋到的地方。[5] 這道工事,是法國防禦體系裡最容易稽核、也最看得見的一環;而真正躲在「表現」背後的那套「指揮思維」,不是視察員巡一巡城牆就能看透的東西——而它,正是最先垮掉的一環。
蘇聯國家計劃委員會(Gosplan,1930年代至1980年代)。 中央計劃經濟靠配額運轉:規定要生產多少噸鋼鐵、多少公尺布料、多少台拖拉機。工廠學會了精準命中數字,即使做出來的東西完全沒用也在所不惜——太大而派不上用場的釘子、清一色同一個尺碼的鞋子——因為計劃獎勵的是數字本身,不是東西有沒有用。[6] 數十年來,官方統計報出來的都是真實、有時甚至相當亮眼的成長數字。但實際的生產能力、實際的民生福祉、實際該維護的資本設備,卻在一疊疊完全合規的公文底下悄悄腐爛,直到整個系統的產出,在1990年代初的短短幾年內全面崩盤。那項指標被管理得無懈可擊,經濟本身卻不是。
羅馬共和國(西元前二至一世紀)。 元老院照常開會,選舉照常舉行,執政官、護民官、監察官這些老頭銜也都按時遞補,「共和(res publica)」——也就是公民共同擁有國家——這個詞,仍然掛在每一場演說的嘴邊。[7] 但真正撐起這些形式的底層公民精神——一群願意把公共利益放在派系、恩庇與個人野心之上的公民——早已在長達一世紀的土地兼併、只效忠將領而非國家的職業化軍隊,以及不斷升溫的政治暴力之中,被掏空殆盡。[8] 等到奧古斯都正式終結共和體制時,他幾乎沒動任何看得見的名詞或儀式。他不需要動。那些形式,早在一個世代前就已經是空殼了。
這三場崩潰共享同一種結構:看得見的那一層——防禦工事、配額、制度形式——被維持得很好,有時甚至到了最後一刻都還「維持得比以前更漂亮」;而真正撐起現實運作的那一層,卻在底下默默腐朽,任何測量機制都看不見。
五、古老的診斷:Lēḇ
早在「內部狀態」這個詞成為機器學習或認知科學的術語之前,一部非常古老的文獻,就已經指出這個問題的核心所在,並且替它取了名字。希伯來文的 lēḇ(לֵב)——一般譯作「心」——指的並不是現代人講的那種偏向情緒的東西,而是一個人內在的控制中樞:思想、意圖、記憶與意志成形的地方,而且是先於、也獨立於言語與看得見的行為而存在的。[9]
聖經作者對本文一路追蹤的這道落差,描述得精準得驚人。「你要保守你心(lēḇ)勝過保守一切,因為一生的果效由心發出」(箴言4:23)[10] 把 lēḇ 當成源頭,而一切下游的行為,也就是「一生的果效」,都只是這個源頭的反映;只顧守住行為卻不顧守住源頭,等於只治標不治本。「人心(lēḇ)比萬物都詭詐,壞到極處,誰能識透呢?我耶和華鑒察人心、試驗人肺腑,要照各人所行的、按他做事的結果報應他」(耶利米書17:9-10)[11] 講得更尖銳:lēḇ 不只是私密的,它連對自己都不透明——一個人靠內省去了解自己的內在狀態,本身就靠不住。這正是第二節講的「可解釋性問題」,只不過這次拿來檢視的對象換成了人自己。
同樣的模式,也出現在制度性的判斷上。先知撒母耳奉命去膏立新王,一開始被候選人高大威武的外表吸引,卻立刻被糾正:「耶和華不像人看人,人是看外貌,耶和華是看內心(lēḇ)」(撒母耳記上16:7)。[12] 而當某個宗教體制已經把外在合規做到極致——洗手的儀式、飲食的禁忌、字句上的一絲不苟——內裡卻早已按經文的標準腐爛時,經文給出的診斷不是「你們的規矩訂錯了」,而是:「從外面進去的不能污穢人……從裡面出來的,才會從人心(lēḇ)發出,才會污穢人」(馬可福音7:15,20-23)。[13] 這裡點出的失效模式,跟國家計劃委員會底下那些工廠的問題一模一樣:對外部指標做到完美合規,卻對指標永遠看不到的那一塊隻字不提。
這套古老的框架之所以不只是歷史趣聞,是因為它並沒有停在「診斷」這一步。它先承認 lēḇ 連自己都看不透、也無法靠自己修好——「誰能識透呢?」——接著並沒有開出更嚴格的自我監督、更用力的內省,或更繁瑣的外在規條當藥方。它開出的,是一種性質完全不同的介入:「我也要賜給你們一個新心(lēḇ),將新靈放在你們裡面,又從你們肉體中除掉石心,賜給你們肉心」(以西結書36:26)。[14] 這句話的主張是:內在的狀態,不是一個系統能靠自己從裡面稽核、修補完成的東西——它需要的是一個來自系統之外的介入。而這恰好正是第二節那些可解釋性研究人員,面對複雜的優化系統時得出的結論;也恰好正是第四節那三場崩潰,用「從頭到尾沒人處理過內裡」示範出來的結論。
六、結語:那個被漏掉的層次
本文檢視的四個領域——機器模型、人類認知、崩潰的制度、古代神學——彼此毫不知情,卻各自獨立得出同一個結構性的觀察:看得見、能打分數的東西,不等於真正在驅動這個系統的東西;而只要時間夠久、壓力夠大,光優化那層看得見的表面,遲早會把底下那層徹底掏空。
這裡的教訓,並不是要我們對表面行為一律抱持懷疑——禮貌、堅固的防禦工事、運作正常的行政體系,都不是沒有意義的。真正的提醒是:別把它們誤當成系統的全部。馬奇諾防線是真的鋼筋水泥,只是它從來不是決定戰局的那一層。國家計劃委員會的數字是真的數字,只是它們從來不是餵飽人民的那一層。羅馬共和的選舉是真的選舉,只是它從來不是把國家凝聚在一起的那一層。而一個人——或一個模型——那些打磨過、順從的輸出,也是真的輸出,只是它從來不是真正決定結果的那一層。
本文檢視的這些最古老的文獻,下了一個很明確的判斷:表層底下的那一層,無論表層管理得多精細,都無法靠管理表層去觸及,因為問題根本不住在表層。無論一個人在神學立場上怎麼看待這個判斷,它所描述的這種模式,確確實實同時出現在一篇談神經網路內部活動的論文裡、一篇談工作記憶容量的論文裡,以及三個帝國的廢墟之中。四個彼此毫無交集、也從未打算互相呼應的領域,卻交出了如此一致的答案——這本身就是一件值得多想一下的事。
找到你的處境
表層與底下真正在運轉的東西之間的這道落差,會因你站的位置不同,而呈現出不一樣的樣貌。如果其中一個更貼近你的處境,就從那裡開始讀——每篇都是短文,讀完會回到這裡。
- 給居民 — 當演練順利落幕,心裡某個地方卻依然不對勁
- 給公民 — 當罰單乖乖繳了,卻沒有一分一毫是心甘情願的
- 給伴侶 — 當家裡表面風平浪靜,但也僅止於表面
- 給父母 — 當孩子越來越聽話,誠實卻同步在流失
- 給上班族 — 當整個團隊的士氣分數一片亮眼,團隊本身卻不是
- 給役男與幹部 — 當每一格都打了勾,卻沒有人真的被照顧到
- 給駕駛與行人 — 當安全確認完全做對了,卻還是不夠
註腳
- [1] Charles Goodhart, "Problems of Monetary Management: The U.K. Experience" (1975);後由 Marilyn Strathern 在 "'Improving Ratings': Audit in the British University System," European Review 5, no. 3 (1997) 中,普及為「古哈特定律」。
- [2] Anthropic, "A global workspace in language models"(2026年7月):報告在Claude模型中發現「J-Space」,一個透過「J-Lens」可解釋性技術觀察到的結構化內部區域,並指出它與全域工作空間理論(見第三節)的相似性。
- [3] George A. Miller, "The Magical Number Seven, Plus or Minus Two," Psychological Review 63, no. 2 (1956): 81–97。後由 Nelson Cowan 修正為嚴格條件下大約四個記憶組塊——確切數字仍有爭議,瓶頸的存在則沒有。
- [4] Bernard Baars, A Cognitive Theory of Consciousness (Cambridge University Press, 1988);全域工作空間理論。
- [5] Ernest R. May, Strange Victory: Hitler's Conquest of France (Hill and Wang, 2000):真正決定勝負的是法國指揮思維的僵化,而非防禦工事本身的品質。
- [6] Alec Nove, An Economic History of the USSR, 1917–1991 (Penguin, 1992):論國家計劃委員會配額制度如何導致反效果的生產結果。
- [7] Ronald Syme, The Roman Revolution (Oxford University Press, 1939):論共和體制的詞彙與官職,如何延續進入獨裁體制的轉型過程。
- [8] Mary Beard, SPQR: A History of Ancient Rome (Liveright, 2015),第7-8章:論土地兼併、軍隊職業化,以及晚期共和公民共識的侵蝕。
- [9] Hans Walter Wolff, Anthropology of the Old Testament, trans. Margaret Kohl (Fortress Press, 1974),第4章:論 lēḇ 作為智力與意志的所在,而非主要指情感。
- [10] 箴言4:23。
- [11] 耶利米書17:9-10。
- [12] 撒母耳記上16:7。
- [13] 馬可福音7:15,20-23。
- [14] 以西結書36:26。
附錄:學術參考書目
一、系統理論與AI可解釋性
- Goodhart, Charles. "Problems of Monetary Management: The U.K. Experience." 1975.
- Strathern, Marilyn. "'Improving Ratings': Audit in the British University System." European Review 5, no. 3 (1997).
- Anthropic. "A global workspace in language models." 2026. 提出「J-Space」概念,以及用來觀察並操控它的「J-Lens」可解釋性技術。
二、認知科學
- Miller, George A. "The Magical Number Seven, Plus or Minus Two." Psychological Review 63, no. 2 (1956).
- Cowan, Nelson. "The Magical Number 4 in Short-Term Memory." Behavioral and Brain Sciences 24, no. 1 (2001).
- Baars, Bernard. A Cognitive Theory of Consciousness. Cambridge University Press, 1988.
三、歷史案例研究
- May, Ernest R. Strange Victory: Hitler's Conquest of France. Hill and Wang, 2000.
- Nove, Alec. An Economic History of the USSR, 1917–1991. Penguin, 1992.
- Syme, Ronald. The Roman Revolution. Oxford University Press, 1939.
- Beard, Mary. SPQR: A History of Ancient Rome. Liveright, 2015.
四、聖經研究:希伯來文 Lēḇ
- Wolff, Hans Walter. Anthropology of the Old Testament. Trans. Margaret Kohl. Fortress Press, 1974.
- 箴言4:23;耶利米書17:9-10;撒母耳記上16:7;馬可福音7:15,20-23;以西結書36:26。