世界模型的推理轉向:PhiZero 把物理動態搬出畫素空間
PhiZero 於 2026 年 7 月 29 日發布,從野外影片自監督學出「物理語言」,採先推理再渲染的架構生成物理連貫的影片

重點摘要
- PhiZero 於 2026 年 7 月 29 日發布,從野外影片自監督學出「物理語言」,採先推理再渲染的架構生成物理連貫的影片
- 現有世界模型把物理動態隱含在高維像素預測器裡;PhiZero 把世界狀態轉移壓縮成離散符號序列,讓推理步驟顯式化
- 論文在生成與理解兩類基準測試上驗證物理連貫性,但能力宣稱來自單篇論文自述,尚未獨立驗證
2026 年 7 月 29 日,Hugging Face 上線論文《PhiZero: A World Model Built Around Physical Language》,提出用離散的「物理語言」把世界動態從像素空間裡搬出來的架構。當前主流的物理世界模型通常直接在像素空間預測未來影片,物理動態藏在高維視覺預測器的參數裡,沒有獨立的推理步驟。PhiZero 換了一條路:從野外影片自監督學出一套描述世界狀態轉移的離散壓縮表示,論文稱之為「物理語言」;有了這套語言,模型先推理世界如何演變,再把推理結果渲染成影片。
PhiZero 透過自監督學習將世界狀態轉移壓縮為離散符號,開創了「先推理、後渲染」的世界模型新架構,試圖將物理動態從像素空間解放為可顯式操作的物理語言。
什麼是「物理語言」,它和直接預測像素差在哪?
在現有的影片生成型世界模型裡,物理直覺是隱式的:模型看大量影片、學到統計結構,輸出時直接在像素或潛在空間做預測。物理邏輯藏在連續高維空間的梯度裡,模型說不清楚「為什麼這個球往那個方向落」,也難以在推理鏈中途修正或介入。
PhiZero 的「物理語言」走的是另一條路:透過自監督從大量野外影片中學出世界狀態轉移的離散壓縮表示,把連續的物理過程對應成一套有限詞彙的符號序列。理論上,這讓世界動態不再隱含在神經網路權重裡,而是可以用符號序列顯式描述和操作的東西。影片生成因此拆成兩步:先用物理語言序列推論「世界接下來怎麼演變」,再把推論結果渲染成像素影片。
這種拆法對照的是語言模型把推理外化成文字序列:大型語言模型在生成答案前先在文字空間推理;PhiZero 做的,看起來是把同樣的邏輯搬到物理世界動態上,這也是論文自己點出的設計動機。
reason-then-render 在技術上打開什麼,又封住什麼?
先推理再渲染的分離,理論上帶來幾個好處。推理發生在離散符號層,中途可查、可剪接,比純端對端的影片預測調試起來可觀察性更高。論文宣稱在生成與理解兩類基準測試上都能展現物理連貫的世界演變,並展示了互動場景下的潛力(原文在此截斷,細節不明)。不過,「物理連貫」能達到什麼程度、在哪些場景失效,目前僅為論文單方面宣稱,尚無外部獨立評測,這點要誠實標記。
代價也很清楚:這條路線的上限,由從野外影片自監督學出的物理語言品質直接決定。如果離散符號沒辦法精確捕捉物理狀態轉移,後面的渲染步驟再好,也只是視覺上的平滑,物理上仍然是錯的。用野外影片做自監督預訓練而不只靠模擬器標注資料,理論上讓模型泛化到新場景時更有彈性,但「野外影片能學出多精確的物理語言」,是這條路繞不過去的核心問題。
做世界模型或物理感知的工程師,具體要追哪些細節?
PhiZero 的設計指向一個更根本的選擇:世界動態的表示,到底應該放在哪一層?多數現有做法把物理動態當像素預測的副產品;PhiZero 把它拆出來壓縮成離散符號,讓物理推理成為獨立的一步,優點是可解釋、可介入,但也讓物理語言的品質成為新的瓶頸。
幾個具體的技術細節值得追蹤:物理語言的詞彙大小與覆蓋範圍、自監督預訓練用了哪些野外影片資料集,以及 reason-then-render 兩段模型各自的規模與訓練成本。論文在 Hugging Face 上線,細節可查,但後續的可複現性與獨立評測,才是判斷這條路走不走得通的關鍵依據。
目前看來,PhiZero 提的是一個設計方向,不是一個已被獨立驗證的工業可用系統。它的價值在於把「先用物理語言推理、再渲染」這條路明確立案,讓世界模型的設計討論多了一個有結構的對照點。這條路線能否比純影片預測更物理自洽,以及能否成為世界模型領域的主流做法,還需要更多場景的壓力測試和不同團隊的獨立複現才能說話。

