DeltaMedia
2026-07-21
模型動態

800K 參數,100% 正確:消去式推理為何讓大模型看起來像在猜謎

AI 圈有個根深蒂固的假設:規模越大,能力越強。

800K 參數,100% 正確:消去式推理為何讓大模型看起來像在猜謎

AI 圈有個根深蒂固的假設:規模越大,能力越強。更多參數、更多算力、更長訓練,問題就解決了。這個邏輯在語言理解、程式生成等任務上確實成立,但最近一篇論文戳到了它的盲點。

論文提出的模型叫 Lattice Deduction Transformer(LDT),只有 800K 個參數,訓練時間 15 分鐘。拿去測 Sudoku-Extreme 和 Maze-Hard 這兩個結構化推理任務,前者正確率 100%、後者 99.9%。相比之下,GPT-5.4 和 Claude Opus 在同樣的任務上得分是 0%。

這個落差不是小差距,是量級的不同。

機制差異才是重點

LDT 的核心不是「猜得更準」,而是根本不猜。它的推理方式接近 SAT solver:每一輪迭代,模型掃描目前的狀態,把邏輯上不可能的選項全部排除;如果某條路走到死路,就回頭(backtrack)重試。這個流程持續循環,直到找到唯一合法解。

結果是:LDT 要麼給出正確答案,要麼直接棄答(abstain)。它的設計讓它沒有辦法輸出一個「感覺合理但其實錯誤」的答案,也就是通用大模型最常出現的問題。

論文還提到一個反直覺的關係:訓練時間越長,推理時的猜測行為越少。這在傳統大模型的框架下幾乎說不通,卻在 LDT 的機制下完全合邏輯,因為更充分的訓練讓消去規則更精確,每個循環能刪掉更多不可能解,縮小模糊空間。

這代表什麼

先說清楚:LDT 的強項限定在高度結構化、有明確規則的任務上。Sudoku 和 Maze 不是語言問題,它們是約束滿足問題(constraint satisfaction problem),有固定的合法解空間。這類任務天然適合消去式推理,通用大模型靠機率分布生成答案的方式在這裡反而是劣勢。

但這個限制本身就是啟示。

很多工程任務實際上也高度結構化:程式驗證、邏輯電路分析、形式化規格檢查、部分排程問題。這些場景和 Sudoku 在結構上沒有本質差異,差的只是規模和複雜度。如果 LDT 的機制能推廣到這類任務,那麼用極小參數的模型取代昂貴的通用推理模型,看起來不是不可能的事。

另一個商業角度是可信賴性。通用大模型的 hallucination 在很多場景下是真實的部署風險,使用者不知道什麼時候模型在瞎猜。LDT「要麼正確要麼棄答」的特性,理論上能把這個風險結構化:至少你知道它棄答了,不會拿到一個看起來正確的錯誤答案。

對你的判斷

Scaling 作為主要路徑,在通用任務上短期內仍然難以撼動。但這篇論文提醒了一件事:如果你的問題有明確的結構和驗證條件,neural-symbolic 的方向值得認真評估,而不是預設「我需要更大的模型」。

具體來說,幾個問題值得問:你的任務是否有形式化的正確或錯誤判準?你能接受模型棄答,而不是要求它永遠輸出內容?如果都是肯定答案,LDT 這類架構的成本優勢,訓練 15 分鐘、800K 參數,可能比你想的更有實際意義。

Scaling 不是唯一路徑,這句話已經說了幾年。LDT 目前看來是一個比較具體的反例:在對的問題上,小而精準的架構可以讓大模型的參數數字看起來很尷尬。

相關公司 OpenAI Anthropic
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則