DeltaMedia
2026-07-21
Agent與應用

Qwen 3.6 35B 翻案:實測揭示 KV Cache 壓縮才是 Agent 任務的隱性瓶頸

一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.

Qwen 3.6 35B 翻案:實測揭示 KV Cache 壓縮才是 Agent 任務的隱性瓶頸

一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.6 35B IQ4NXL 搭配未壓縮 KV cache,問題幾乎一次解決。實測對比顯示:35B IQ4NXL(KV 未壓縮)表現超越原本日常主力 Qwen 27B Q5KXL UD @ KV Q8/8,差距更延伸到 27B Q4 @ KV Q4/4。

作者原以 unsloth 的 Qwen 27B Q5KXL UD @ KV Q8/8 為日常驅動,理由是 27B 在 Qwen 3.5 世代的智力評估明顯高於 35B,速度也不是首要考量。轉折點是 Rivet agentic 流程中的高 context 場景:context 溢出觸發量化降級,模型進入「智力截頂」狀態,反覆循環燒掉大量工時。換上 35B IQ4NXL 並取消 KV cache 壓縮後,原本卡住的問題幾乎一次命中。他也指出 35B 在高 context 下速度明顯下滑,若要維持速度只能退回 Q4KXL @ KV Q4/4,但又承擔遺漏細節的風險。

這則實測的核心結論是:「KV cache 壓縮只損失少量智力」的常見假設,在長 context、多步推論的 agentic 場景中看起來明顯低估了代價,差距足以將數分鐘的任務拉長為數小時的除錯。對本機 LLM 工程師而言,VRAM 應優先分配給推論量化還是 KV cache 保真度,這個取捨在 agent 可靠性比純對話品質更關鍵的工作流中,值得重新評估。

相關公司 Alibaba
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則