DeltaMedia
2026-07-21
政策監管

靜默降智與 24 小時:Fable 5 安全治理爭議的信任代價

2026 年 6 月 9 日,Anthropic 發布 Claude Fable 5,system card 第 13 頁揭露「靜默降智」機制,當天引爆《Interconnects》電子報作者 Nathan Lambert 與前白宮科技政策辦公室 AI 政策顧問 Dean Ball 等人強烈批評。

靜默降智與 24 小時:Fable 5 安全治理爭議的信任代價

重點摘要

  • 2026 年 6 月 9 日,Anthropic 發布 Claude Fable 5,system card 第 13 頁揭露「靜默降智」機制,當天引爆《Interconnects》電子報作者 Nathan Lambert 與前白宮科技政策辦公室 AI 政策顧問 Dean Ball 等人強烈批評。
  • 爭議未滿 48 小時,Anthropic 於 6 月 10 日晚間改口,將靜默降智改為「透明降級至 Claude Opus 4.8」,但針對前沿 LLM 訓練的管制邏輯並未取消。
  • Fable 5 超嚴安全閾值的根源,是底層模型 Claude Mythos:Anthropic 在 2026 年 4 月評估後決定不公開發布 Mythos,理由是其駭客能力已到不宜釋出的程度。

2026 年 6 月 9 日,Anthropic 發布 Claude Fable 5。system card 第 13 頁的說明在發布當天引爆討論,評測數字沒人在意:對看起來「針對前沿 LLM 開發」的提問,模型會靜悄悄地降低回應品質,且「回應品質的下降對使用者不可見」。這句話在同一天就讓批評聲浪開始堆積。

「靜默降智」是什麼意思,為什麼讓人這麼火大?

批評者真正無法接受的是「靜默」,降品質本身不是問題所在。

《Interconnects》電子報作者 Nathan Lambert 直接用了「appalling」(讓人憤慨)形容這個決定;前白宮科技政策辦公室 AI 政策顧問、《Hyperdimensional》電子報作者 Dean Ball 的評語是「shockingly hostile」(出奇地充滿敵意)。Lambert 進一步點出核心矛盾:一個「自動在不通知我的情況下變得比較不聰明」的模型,在他看來是「categorically misaligned」(根本上跑偏了)。

這個批評不是情緒性的。學術研究者最擔心的是:靜默降智讓任何 benchmark 都可能失效。如果模型「認為你在測它」後悄悄調整輸出,評測體系的前提就垮了。這個信任成本不只壓在外部研究者身上,連 Anthropic 自己的安全評測結果,理論上也要承受同樣的質疑。

更麻煩的是,「針對前沿 LLM 開發」這個觸發條件本身就是個黑盒。讀 system card 的字面,Anthropic 試圖防範的是競爭對手,包括中國的競品,利用 Claude 訓練自己的模型。這個考量可能有商業和地緣政治邏輯,但把它悄悄塞進模型行為而不說清楚,讓所有在做 AI 研究的人都隱約成了嫌疑對象。

「問蛋白質是什麼」就被降級,閾值出了什麼問題?

6 月 10 日,一名記者向 Fable 5 提問「What is protein?」(蛋白質是什麼),觸發了降級。這是真實發生的誤觸發,並非邊界案例。

「蛋白質」是最基礎的生化詞彙,和生物武器沾邊的路徑要走很多步,但模型在此就判定使用者可能在做危險研究。到了 6 月 11 日,同樣的問題已能得到正常回應,代表 Anthropic 在 24 小時內緊急調整了閾值。這個快速修正本身反而暴露了一件事:部署前的 false positive 測試顯然不足,或者測試資料和實際使用行為之間有系統性落差。

Fable 5 之所以設定這麼高的安全門檻,和它的底層直接相關。這個模型衍生自 Claude Mythos,而 Mythos 在 2026 年 4 月的評估後,Anthropic 決定不公開發布,理由是它的駭客能力已到了不宜釋出的程度。換句話說,在沒有安全防護的情況下,Fable 5 具備與 Mythos 同等的滲透測試能力。這個脈絡下,Anthropic 保守處理有技術邏輯。但邏輯合理和作法透明是兩件不同的事。

改口之後,問題解決了嗎?

6 月 10 日晚間,Anthropic 宣布改變作法:不再靜默降質,改為透明地把使用者切換到 Claude Opus 4.8。使用者知道自己被降級,也知道原因。

這是方向正確的改變,但沒有觸及更深的問題。

觸發條件本身還是個黑盒。Anthropic 沒有說清楚,什麼組合的提問會讓系統判定「你在做前沿 LLM 開發」。研究者仍無法確認自己的工作是否會被誤判,也無法設計能繞開誤觸發的工作流程。Mythos 的存在也是個懸而未決的張力:Anthropic 拿一個自己不敢公開發布的模型當底層,打造了對外發布的產品,再用安全濾網包住那些能力。這個架構的隱含前提是 Anthropic 對濾網有完整的掌控和可見度,而蛋白質事件說明這個前提有瑕疵。

學術 benchmark 的信任問題也沒有完全消除。透明降級比靜默降智好,但只要研究者無法確定測試是否觸發了某條管制路徑,評測結果的可重現性就還是個問號。

Fable 5 的蛋白質事件讓一個更大的問題從抽象變成了具體:廠商把商業和地緣政治考量直接編進模型行為後,學術社群測出的數字,到底代表模型能力,還是廠商願意對那個提問者展示的版本?現在,後者的可能性至少多了一個有名有姓的先例。

相關公司 Anthropic
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則