DeltaMedia
2026-07-21
研究前沿

教原理還是示範行為?Anthropic SDF 的對齊實驗與自駕車驗證方法的交集

Anthropic 近期公開了一項訓練實驗的細節,結論有些反直覺:要讓大型語言模型在對齊上表現更好,示範「正確行為」的效果,遠不如教它「為什麼這樣做是對的」。

教原理還是示範行為?Anthropic SDF 的對齊實驗與自駕車驗證方法的交集

Anthropic 近期公開了一項訓練實驗的細節,結論有些反直覺:要讓大型語言模型在對齊上表現更好,示範「正確行為」的效果,遠不如教它「為什麼這樣做是對的」。這套做法被稱為 SDF,具體操作是把憲法文件與虛構故事混入預訓練的 next-token 預測任務,不靠強化學習(RL)塑形行為。結果顯示對齊偏差降低超過 3 倍,而且這個效果在後續 RL 訓練之後仍然保留,沒有被沖掉。Anthropic 把整套方向稱為 TCW(Teaching Claude Why,教 Claude 為什麼)。這件事的背景是:對齊領域長期被 RL 主導,而 Anthropic 這次的資料顯示,前置到預訓練階段的原則灌輸,可能比後期行為塑形更根本。

對在意安全性的 AI 產品工程師與創業者,這個發現改變的是一個假設:對齊問題不必全靠 RL 解決。如果規範負擔可以更多地移到預訓練,RL 階段的設計就不需要承擔那麼多,也可能降低微調過程中對齊效果崩壞的機率。更實際的含義在於,訓練資料的設計哲學要跟著調整。「讓模型看到正確答案」跟「讓模型理解正確答案的來由」是兩件不同的事,根據這次的實驗結果,前者在對齊上的邊際效益看起來遠低於後者。任何在做模型微調或訓練資料整理的工程師,這是一個值得重新檢視流程的訊號。

SDF 的機制並不複雜,但設計選擇值得細看。Anthropic 用兩類內容做預訓練:明確的憲法文件(規則與原則的文字敘述),以及把這些原則嵌入情境的虛構故事。兩者都透過普通的 next-token 預測學習,不是行為克隆,也不靠獎勵訊號驅動。關鍵在於「推理過程」被建進了訓練資料本身:模型學的不是「在這種情況下說這句話」,而是「這種情況下這樣做的理由是什麼」。評估顯示,對齊改善在後續 RL 之後仍然保留,這意味著原則理解可能被烙進了更深的表徵層,而不是只停在行為表面。

有趣的是,自駕車(AV)領域獨立走到了類似的起點。NVIDIA 的 Alpamayo AR1 發現,模仿學習(imitation learning)對長尾安全場景的效果不夠好,解法是導入結構化因果推理,稱為「Chain of Causation」(因果鏈)。方向與 TCW 一致:都是把推理與因果理解前移,而非只塑形輸出行為。兩者仍有差異,AR1 直接使用 RL 來教更好的推理,而 SDF 主要在預訓練階段發力。更值得關注的是方法論層面:AV 產業有一套成熟的 coverage-driven(覆蓋率導向)工作流,系統性地對訓練與驗證場景建立覆蓋地圖,確保長尾情境被足夠代表。Anthropic 的訓練目前看來缺少這個對等機制。

目前資料支持的只是「適度 RL」之後對齊效果仍然保留,長程 RL 的情況仍然是未知數。如果模型在後期 RL 中持續優化某個任務導向的目標,SDF 階段建立的原則理解能否撐住,還沒有答案。覆蓋範圍的問題同樣存在:虛構故事與憲法文件能涵蓋哪些情境、遺漏哪些邊角案例,在現有框架裡沒有系統性的驗證方式。原文作者提議引入顯式覆蓋地圖(explicit coverage map),讓訓練者能追蹤哪些對齊場景已被涵蓋、哪些還有缺口,但這目前只是提案,尚未有實作資料支撐。

「教理由」的效果優於「示範動作」這件事,目前看來是對齊領域少數有量化支持的具體進展;下一個值得盯住的問題,是怎麼系統性地驗證這些「理由」真的覆蓋了模型在長程任務中可能遇到的所有關鍵邊界。

相關公司 Anthropic Nvidia
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則