GEAR 提出端到端自回歸影像合成新架構,ImageNet gFID 達 2.52
GEAR 透過雙路徑機制解決向量量化索引不可微問題,實現 tokenizer 與自回歸生成器的聯合訓練,打破傳統兩階段訓練的最佳化瓶頸。

重點摘要
- GEAR 透過雙路徑機制解決向量量化索引不可微問題,實現 tokenizer 與自回歸生成器的聯合訓練,打破傳統兩階段訓練的最佳化瓶頸。
- 在 ImageNet 256×256 基準測試中,GEAR-XL 達到 2.52 的 gFID 與 262.94 的 Inception Score,收斂速度比 LlamaGen-REPA 基準快 10 倍。
- 聯合訓練促使程式碼簿使用分佈轉向低熵、更具可預測性,並改善自回歸模型的 patch 層級對齊,但 tokenizer 表徵特徵與擴散模型產生相反變化。
2026 年 6 月 30 日,北京大學與騰訊混元團隊共同發布論文 GEAR(Guided End-to-End AutoRegression for Image Synthesis),提出一種針對影像合成的端到端自回歸訓練方法。這項研究由 Bin Lin、Zheyuan Liu 等十一位研究人員共同完成,旨在解決傳統自回歸影像生成中 tokenizer 與生成器分離訓練所導致的最佳化斷層問題。GEAR 的核心突破在於設計了一套雙路徑機制,讓離散的向量量化索引能夠傳遞梯度,從而實現兩者的聯合最佳化。在 ImageNet 256×256 類別條件生成任務上,擁有 775M 參數的 GEAR-XL 模型取得了 2.52 的 gFID 與 262.94 的 Inception Score,生成品質與訓練效率明顯超越現有基準。
傳統兩階段訓練的結構性缺陷為何?
自回歸影像生成長期受困於 tokenizer 與生成器的解耦訓練模式。傳統正規化首先訓練一個用於重建的 tokenizer,隨後將其凍結,再獨立訓練生成器以處理離散索引或連續潛變數。這種設計導致 tokenizer 完全不知道生成器偏好哪些特徵,形成最佳化盲區。更關鍵的技術障礙在於,饋入自回歸模型的向量量化索引本身是不可微的,梯度無法反向傳播至 tokenizer。研究團隊指出,過去嘗試使用直通估計器(straight-through estimator)來彌補梯度斷層,但該方法在訓練過程中容易崩潰,無法穩定支撐端到端最佳化。
這種結構性缺陷限制了自回歸模型在影像合成領域的潛力。生成器被迫適應一個靜態且可能次優的程式碼簿,而 tokenizer 則缺乏來自生成任務的反饋訊號來調整其表徵空間。GEAR 填補了這一空白,它不依賴凍結的 tokenizer,而是讓兩者共同演化。GEAR 透過架構層面的創新,試圖從根源上消除這種協同失效。
雙路徑機制如何解決不可微問題?
GEAR 解決方案的核心,是針對程式碼簿設計雙重讀取機制。系統包含一個硬分支與一個軟分支,兩者並行運作以滿足不同需求。硬分支採用標準的 one-hot 編碼,用於訓練自回歸模型進行下一個 token 預測,這確保了推理階段能維持離散 token 的穩定性與效率。軟分支則引入溫度加權的插值機制,在最近的程式碼字之間進行可微的軟分配,從而攜帶表徵對齊損失(representation-alignment loss)並反向傳播至 tokenizer。
這種設計巧妙地避開了直通估計器的不穩定性。軟分支提供的可微梯度讓 tokenizer 能根據生成器的需求調整其表徵,而硬分支則保留了自回歸模型所需的離散結構。研究顯示,這種雙路徑架構不僅解決了梯度流斷層,還促進了程式碼簿使用分佈的重組。在聯合訓練下,程式碼簿的使用傾向於低熵、更容易預測的索引分佈,自回歸模型也因此更容易建模與預測。與傳統方法相比,GEAR 在 ImageNet gFID 上的收斂速度提升了 10 倍,這表明端到端訓練能更有效地利用計算資源。
基準測試結果揭示了什麼效能躍進?
GEAR 在多項基準測試中,效能明顯比較好。在 ImageNet 256×256 類別條件生成任務中,擁有 343M 參數的 GEAR-L 模型達到 2.95 的 gFID 與 239.75 的 Inception Score,優於同等規模的 LlamaGen-REPA-L 基準(gFID 3.15,IS 208.14)。更大規模的 GEAR-XL(775M 參數)進一步將 gFID 降至 2.52,Inception Score 提升至 262.94。這些數字不僅代表生成品質的提升,也顯示出模型規模擴充套件的有效性。
在文字到影像生成任務中,GEAR 同樣表現出色。使用包含 1 億張影像的 GPIC 資料集,在 10 萬步訓練後,GEAR 將 Fréchet DINO Distance(FDD)從 LlamaGen-REPA 基準的 198.6 降至 177.4,改善幅度達 10.6%。經過 39 萬步訓練後,FDD 進一步從 127.9 降至 115.3,改善 9.9%。這些結果是在使用無分類器引導(classifier-free guidance)的情況下取得的,顯示 GEAR 在複雜條件生成任務中的穩定性。此外,GEAR 的架構具有高度相容性,能在 VQVAE、LFQ 和 IBQ 等多種量化器架構上運作,並在各架構上實現 4.1 至 7.3 點的 gFID 降低,證明其方法論的通用性。
聯合訓練如何重塑模型內部表徵?
GEAR 的聯合訓練不僅提升最終生成品質,更深刻改變了模型內部的表徵結構。研究觀察到,在 GEAR 訓練下,tokenizer 的表徵變得較不像 DINOv2 特徵,這與擴散模型產生的效果相反。擴散模型通常會強化 tokenizer 與預訓練視覺編碼器的對齊,而 GEAR 則讓 tokenizer 更專注於服務自回歸生成器的需求。同時,自回歸模型在 patch 層級的對齊能力顯著改善,這意味著模型能更精確地捕捉影像的區域性結構與細節。
這種表徵重組反映了端到端最佳化的本質差異。傳統方法中,tokenizer 與生成器各自最佳化不同的目標,導致表徵空間可能存在錯位。GEAR 讓兩者共同尋找一個對生成任務最優的平衡點。程式碼簿使用分佈向低熵轉變,意味著模型學會了更集中、更高效地使用程式碼簿容量,而非隨機分散。這種內部結構的最佳化,或許就是 GEAR 收斂速度大幅提升的主因。然而,tokenizer 表徵與 DINOv2 的偏離也引發了新的討論:這種專為自回歸最佳化的表徵,是否會犧牲模型在其他視覺任務上的泛化能力?這點仍有待後續觀察。
GEAR 的出現標誌著自回歸影像合成技術的重要進展。透過解決梯度不可微的長期痛點,研究團隊證明瞭端到端聯合訓練的可行性與優勢。其在 ImageNet 與 GPIC 資料集上的卓越表現,以及對多種量化器架構的相容性,顯示出該方法具備廣泛的應用潛力。隨著生成模型向更高效、更可控的方向發展,GEAR 提供的雙路徑機制與表徵重組洞察,為後續研究提供了寶貴的參考座標。對於技術背景的創業者與工程師而言,理解這種架構級別的最佳化策略,有助於在資源受限的情況下設計更高效的生成系統。


