xAI Ethan He:影片模型的智能源自 LLM,下一個 Sora 是影片 Agent
前 NVIDIA Cosmos 世界模型主導工程師 Ethan He 加入 xAI 後,率小型團隊在三個月內從零建出 Grok Imagine,並在 Latent Space podcast 拋出反直覺核心論點:影片模型的「智能」主要來自 LLM,不是來自看更多影片訓練資料。
前 NVIDIA Cosmos 世界模型主導工程師 Ethan He 加入 xAI 後,率小型團隊在三個月內從零建出 Grok Imagine,並在 Latent Space podcast 拋出反直覺核心論點:影片模型的「智能」主要來自 LLM,不是來自看更多影片訓練資料。這個判斷直接改寫了影片生成的下一步路線圖。
Ethan He 曾主導 NVIDIA Cosmos 世界模型,隨後加入 xAI。三個月衝刺 Grok Imagine 留下的工程教訓只有兩條:迭代速度高於幾乎一切,最大的效能躍升往往來自修掉資料集與訓練 pipeline 裡的微小 bug,而非架構大改。技術棧涵蓋 VAE、diffusion transformer、音影對齊與推論加速,以及大規模影片資料集移動的隱性成本。
He 認為影片生成將複製 coding AI 的演化弧線,從比拚單次輸出品質與成本,走向多輪規劃、生成、編輯、批評、迭代的 agent 系統,最終瓶頸落在「編排」而非單次生成能力。對做多模態或生成式媒體的團隊,訊號已經很清楚:當 realism、一致性、prompt 遵循達到門檻後,該押注的是能跨整個創作任務統一調度的完整系統。He 同時點名 Flipbook 是影片即時客製 UI 的早期訊號,隨推論成本持續下降,這個方向比多數人預期的更近。
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則

