DeltaMedia
2026-07-21
研究前沿

LongLive-RAG 把 AR 長影片生成轉型成 RAG 問題,以非局部記憶對決滑動窗口漂移

自回歸(AR)影片擴散模型雖能生成任意長度的影片,卻有一個結構性死穴:滑動窗口注意力一旦累積外觀錯誤,後續幀只能在已劣化的軌跡上繼續生成,誤差與身分漂移會越滾越大,且無法回頭修正。

LongLive-RAG 把 AR 長影片生成轉型成 RAG 問題,以非局部記憶對決滑動窗口漂移

自回歸(AR)影片擴散模型雖能生成任意長度的影片,卻有一個結構性死穴:滑動窗口注意力一旦累積外觀錯誤,後續幀只能在已劣化的軌跡上繼續生成,誤差與身分漂移會越滾越大,且無法回頭修正。LongLive-RAG 提出的解法是把問題定性重寫,長影片生成本質是個 RAG 問題,而非單純的上下文延伸。

LongLive-RAG 的核心機制是把所有已生成的 latent 存成一個動態可搜尋的歷史庫。每生成新的一個 block,系統用 query embedding 從歷史庫中撈回最相關的歷史 latent,再以這些非局部條件驅動擴散生成。如此一來,模型可跨越時間跳躍取回早期的關鍵外觀資訊,不再受限於「窗口必須連續」的硬約束。論文強調,檢索步驟相對生成本身屬輕量級額外開銷,且框架定位為通用設計,可掛載不同 AR 擴散架構。

對做生成式影片的工程師,訊號很直接:更大的滑動窗口未必是解法,記憶結構的選擇才決定長程穩定性。這與 LLM 領域用 RAG 繞過上下文長度瓶頸的思路完全同源,差別只是把「文件庫」換成「歷史幀 latent 庫」。若宣稱成立,影片生成的優化重心將從「記憶體換更大窗口」轉移到「設計更精準的 retrieval 策略」,前者燒算力,後者燒架構思維。

本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則