告訴 Gemma「還剩幾步」沒用,但它一開口提,就幾乎必敗
1/
1/
2026 年 7 月 5 日,LessWrong 上一篇個人實驗拋出反直覺結果:在 CTF(Capture the Flag)解題任務裡,每步都告訴 Gemma 還剩幾步可用,解題率幾乎沒有改變,67.6% 對 65.5%,Fisher exact test p 值 0.64,統計上是清楚的虛無結果。但研究者繼續挖 reasoning trace,發現一個更詭異的訊號:在那些模型主動說出「我還剩 2 步」「時間不夠了」的 run 裡,幾乎每次都失敗。
2/
實驗設計直白:3 個 CTF 題庫,每次 run 給 30 步上限,各題庫各跑 100 次 baseline、100 次 step_aware,共 600 次,排除因 race condition 處理失敗的後剩 505 次有效 run。step_aware 組每步都告知剩餘步數。解題率差距落在誤差範圍內,代表這個線索在總體上什麼都沒改變。讓研究者不安的,是微觀行為。
3/
研究者拆開那些「說出資源限制」的 run,整理出三類模式:自我重複(反覆叨唸剩餘步數)、歷史審計(用最後幾步回顧整個 run 的過程),以及「晚期假設」,也就是模型在快跑完時突然生出一個全新假設,但顯然已沒有步數去驗證。問題不在於說沒說,而在於時機:首次提到資源限制的中位數步驟是第 28 步,距離上限 30 步只剩兩步。約束意識浮出來,已什麼都來不及了。
4/
研究者的核心判斷是「線索被處理,但沒被使用」。Gemma 確實讀到步數資訊,也確實把它說了出來,卻沒有在較早的時間點換策略、縮減搜索範圍或放棄高風險路徑。理論上,具備策略性資源規劃的 agent 應該在步數進入警戒區之前就開始收束;但實驗裡看到的是,模型到第 28 步才形成新假設,而那個假設已沒有執行的空間。資源感知和資源規劃之間,看起來有一道缺口。
5/
這對做 agent 部署的工程師的意義在於:CTF 是步數有限的環境,但步數上限、token 預算、時間截止在真實部署同樣普遍。如果這個行為模式不只出現在 Gemma 或 CTF,那麼任何設計上依賴「模型感知到資源緊張就自動提早調整」的系統都可能有漏洞。
6/
必須誠實標註:這是單一研究者的個人實驗,505 次 run、單一模型 Gemma、三個 CTF 題庫,還沒有第三方在其他模型上複現。「凡說出資源限制就幾乎必敗」這個相關性是真實的資料訊號,但背後機制和跨模型的普遍性仍是開放問題。在有更多複現證據之前,這份實驗至少值得 agent 工程師在設計步數上限或資源預算機制時多想一層:你的系統是否假設了模型會自己管好剩餘預算?那個假設,可能還沒被驗證過。


