Oxford/Technion/AITHYRA/NVIDIA 提出 KV-CAT:訓練期遮罩 KV 槽,讓事後壓縮效率從根提升
2026 年 6 月 14 日,Oxford、Technion、AITHYRA 與 NVIDIA 的研究團隊公開論文,提出 KV-Compression Aware Training(KV-CAT),一套在持續預訓練(continued pretraining)階段就強迫 Transformer 學會「以稀疏記憶運作」的訓練方法。
2026 年 6 月 14 日,Oxford、Technion、AITHYRA 與 NVIDIA 的研究團隊公開論文,提出 KV-Compression Aware Training(KV-CAT),一套在持續預訓練(continued pretraining)階段就強迫 Transformer 學會「以稀疏記憶運作」的訓練方法。業界現有的 KV cache 壓縮方案幾乎都是模型訓練完成後才介入,KV-CAT 的切入點不同:把可壓縮性本身當作訓練目標,模型在進入推理部署前就具備「少依賴記憶條目」的能力。這個區別在工程邏輯上有實質差異:事後壓縮是在不破壞模型行為的前提下硬刪記憶,KV-CAT 則讓模型從一開始就預設記憶是稀疏的。
KV cache 是 Transformer 推理時儲存每個 token 鍵值對(key-value pair)的記憶結構,隨輸入長度線性增長,是長上下文推理最直接的成本壓力點。KV-CAT 的核心手法是在持續預訓練期間隨機遮罩 KV 槽(KV slot),在部分注意力歷史被刻意清除的條件下強迫模型維持推理品質,從中逼出稀疏記憶下仍能有效推理的能力。依論文自述,KV-CAT 訓練出的模型在套用事後壓縮演算法時,能以相同或更小的記憶預算,在檢索(retrieval)、長文問答(long-context QA)與困惑度(perplexity)三個基準上超越既有壓縮方法;換句話說,壓縮的「地基」是在預訓練期就打好的,而非推理時硬嵌。
這個結果如果能在更大規模上站穩,理論上代表推理端記憶體用量不必再與上下文長度等比膨脹,長上下文窗口的成本上限看起來有了一條工程路徑可走。相比大多數在訓練後才介入 KV cache 的壓縮方法,KV-CAT 不動推理架構本身,與現有部署棧的相容性理論上較高。不過,這些結論目前均出自研究團隊自述,尚無第三方獨立覆核,在不同架構與任務分佈下的泛化能力仍待外部復現確認。工程團隊若正在評估長上下文部署成本,KV-CAT 目前看來是少數在訓練策略層直接切入記憶效率的具體方案,社群復現後的結果值得盯緊。
