DeltaMedia
2026-07-21
晶片算力

Future-L1 放棄文字代理推理、改走潛在視覺空間,Qwen3-VL-8B 在 FutureBench 從 61.0 拉至 85.4

研究者提出 Future-L1,一個交錯潛在視覺推理框架,讓 MLLM 在自回歸解碼時於語言 token 與連續潛在視覺 span 之間交替,而非把所有中間推理步驟語言化。

Future-L1 放棄文字代理推理、改走潛在視覺空間,Qwen3-VL-8B 在 FutureBench 從 61.0 拉至 85.4

研究者提出 Future-L1,一個交錯潛在視覺推理框架,讓 MLLM 在自回歸解碼時於語言 token 與連續潛在視覺 span 之間交替,而非把所有中間推理步驟語言化。以 Qwen3-VL-8B 為基底,Future-L1 在 FutureBench 上將分數從 61.0 提升至 85.4,並在論文所報告的兩項影片事件預測基準上均取得最新最佳成績。

現有影片 MLLM 的主流做法是將未來推理轉譯成文字,但一旦視覺證據語言化,細粒度的運動、幾何與物件互動線索便會流失,產生文字讀來合理卻視覺上站不住腳的幻覺。Future-L1 的訓練分兩階段:先建構 Future-L1-50K 資料集,篩選未來視覺線索有助於預測的樣本並將潛在狀態對齊至未來幀嵌入;再以 LA-DAPO(帶有 outcome-contrastive 與 temporal-diversity 獎勵的潛在感知強化學習目標)優化採樣到的潛在軌跡。

對做多模態與影片理解的團隊,這篇論文的訊號是:視覺推理正從文字代理空間往潛在視覺空間移動。語言化推理曾是讓 MLLM 具備推理能力的捷徑,但在需要預測細粒度運動與幾何的任務上看起來已到瓶頸。「先想像再預測」的架構方向,理論上可推廣至任何需要精確視覺預見的下游場景,但目前數字來自單一尚未外部複現的論文,應保留觀察空間。

相關公司 Alibaba
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則