DeltaMedia
2026-07-21
政策監管

Anthropic 安全招牌的代價:Fable 5 停供拆解

2026 年 6 月 15 日下午 5:21(東岸時間),Anthropic 收到美國政府出口管制指令,對所有外國籍使用者停用 Fable 5 與 Mythos 5,政府說明已掌握一種越獄(jailbreak)手法,指令中無具體技術說明

Anthropic 安全招牌的代價:Fable 5 停供拆解

重點摘要

  • 2026 年 6 月 15 日下午 5:21(東岸時間),Anthropic 收到美國政府出口管制指令,對所有外國籍使用者停用 Fable 5 與 Mythos 5,政府說明已掌握一種越獄(jailbreak)手法,指令中無具體技術說明
  • Stratechery 作者、獨立科技分析師 Ben Thompson 主觀評估:使用 Fable 後,GPT-5.5 和 Opus 4.8 顯得「又小又笨」,類似 GPT-4 與 Grok 4 當年帶來的世代切換感,他推測 Fable 背後是新一輪預訓練
  • Anthropic 長年以「危險到不能公開」建立的安全定位,在此次事件中同時成為模型能力的佐證,以及政府援引出口管制介入的直接依據

2026 年 6 月 15 日下午 5:21(東岸時間),Anthropic 收到美國政府援引國家安全權限發出的出口管制指令,要求停止所有外國國籍人士對 Fable 5 與 Mythos 5 的存取,範圍涵蓋美國境內外,連 Anthropic 本身的外籍員工也不例外。為確保合規,Anthropic 對全體客戶一律停用這兩個模型,其他所有 Anthropic 模型的存取不受影響。指令沒有附上具體的國家安全關切說明,只透露政府認為已有人掌握繞過 Fable 5 安全機制的越獄手法。

要看清這件事到底是偶發意外還是結構性問題,必須先回到兩個月前。

Fable 5 的能力跳躍,有多大?

大約兩個月前,Anthropic 發布了 Mythos Preview,以「網路安全能力過於先進」為由,聲明這個模型危險到不宜公開。這個說法當時引發了不少質疑,批評者普遍認為只是用恐懼感製造關注。兩個月後,Anthropic 加入安全護欄,以 Fable 為名公開推出可用版本。

Thompson 在文章中明確標示這是主觀體感,但他的對比基準相當具體:使用 Fable 後,GPT-5.5 和 Opus 4.8 在他感覺中「又小又笨」。他說上一次有這種感覺,分別是 GPT-4 問世與 Grok 4 出現時。他指出,這兩個節點都代表底層基礎模型在規模與複雜度上的世代切換。據此,他推測 Fable 很可能是新一輪預訓練的產物,新一代的起點,而不只是在既有架構上疊加的改版。

這個推測目前無法從外部確認,但若方向正確,意涵就不只是「Fable 比較強」。世代切換通常伴隨能力的質變,複雜推理、程式碼生成、安全滲透等多個維度可能同步拉大差距。Anthropic 說 Mythos 在網路安全上特別危險,若真是新世代模型,這個說法理論上就有更多現實依據,而非純粹的行銷操作。

越獄發生後,政府為什麼能這樣介入?

護欄被繞了。根據 Anthropic 的說明,Fable 5 在公開發布後不久就被發現越獄手法,政府對 Anthropic 展示了操作演示,顯示該技術被用來識別「少數已知的次要漏洞」,且這些漏洞「看起來相對簡單」。原始報導在此處截止,越獄技術的具體細節與政府的完整關切,仍待進一步佐證。

從政府介入的角度來看,這次援引的是國家安全權限,而非常規的技術監管程序,是相當高層級的管制工具。Anthropic 在公告中說,收到指令後沒有時間逐一驗證使用者國籍,因此選擇對所有客戶全面停用。停供範圍從外國籍使用者擴大到所有人,是執行層面的不得不為,而非政府原意。

這裡有個值得留意的落差:Anthropic 一方面描述演示出的漏洞相對簡單,另一方面政府仍選擇動用最高層級的出口管制手段。兩者之間的差距,目前公開資訊無法解釋。也許政府的關切不只是那次演示,也許這是更大政策框架的一部分,但這些推測目前都還無法從外部驗證。

對押注閉源前沿 API 的開發團隊,具體意味著什麼?

這次事件揭示的風險結構,比「模型停供」本身更值得拆解,而且有三層。

第一層是模型世代切換的節奏風險。如果 Fable 真的代表一個新世代的開始,接下來的問題是:基於上一代能力設計的 prompt 架構、評估標準、成本模型,在世代切換後有多少需要重建?過去幾年,工程師在 Claude 不同世代之間已經歷了多輪校準。每次切換,底層行為與輸出模式都可能出現超出預期的偏移;若新一代模型的能力差距真的如 Thompson 所感受到的那麼大,重建成本理論上也會跟著放大。

第二層是監管介入的速度風險。這次從越獄到全面停供,在同一天內完成,應對窗口幾乎是零。更麻煩的是,政府指令沒有附上具體的技術說明,外部開發者無從評估類似事件再次發生的機率,也難以判斷什麼樣的模型能力水位會觸發類似反應。

第三層是可用性與地緣政治掛鉤的問題。這次指令的對象是外國籍使用者,執行方式卻是停用所有客戶,因為精準過濾在操作上不實際。這意味著閉源前沿模型的可用性,正在與地緣政治座標產生直接連動。這個因素,過去很少出現在 API 選型的評估清單上。

Anthropic 在這件事上的處境有其特殊性。它是少數從創立之初就把「AI 可能很危險」當作核心主張的公司,這個定位帶來了特定的投資人、政策圈影響力與品牌氣質。問題在於,當同一套說法被政府當作介入依據,Anthropic 很難反過來主張「其實沒那麼嚴重」,因為那會拆掉自己多年建立的論據。這不是道德判斷,而是一種策略上的不對稱:對一家長期宣稱「我的模型很危險」的公司,政府採取行動的話語成本,比對一家說「我的模型很安全」的公司低得多。對開發者來說,最直接的啟示是,模型能力的世代跳躍與監管介入的風險,看起來正在同一個時間軸上放大。前沿 AI 能力愈強,進入政府國安視野的機率就愈高。選型評估裡,現在可能需要多加一個問題:「如果這個模型因監管原因被停供,我的服務脆弱在哪?」

相關公司 OpenAI Anthropic xAI
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則