DeltaMedia
2026-07-21
Agent與應用

開源 Agentic Coding 的差距正在收斂,M3 的真正訊號不是跑分

MiniMax M3 最值得認真看的,不是 SWE-Bench Pro 的 59%,雖然這個數字超過 GPT-5.

開源 Agentic Coding 的差距正在收斂,M3 的真正訊號不是跑分

MiniMax M3 最值得認真看的,不是 SWE-Bench Pro 的 59%,雖然這個數字超過 GPT-5.5 和 Gemini 3.1 Pro、接近 Opus 4.7 確實夠硬。真正的訊號是:它是國內第一個把長上下文、多模態、Coding 三件事同時做到的開源模型。缺少任何一條,agentic 任務就會在中途卡住,複現論文要同時讀圖、理解長篇方法論、產出可執行程式碼;優化 CUDA 算子要把架構文件塞進上下文再生成精確實作。這個能力組合,目前閉源世界只有 GPT、Claude、Gemini 最新旗艦能做到。

效率層面,廠商數據顯示 1M 上下文下每 token 計算量壓到上代 1/20,decoding 加速超過 15 倍。這不只是模型品質問題,它把「跑長上下文 agentic loop」的推理成本從「不切實際」推進「可以落地」的區間。讓 agent 自主跑 12 小時復現論文,成本算不算得平,是第一道工程關卡。

對工程師更重要的,是 MiniMax Code 的設計決策:它不是接入 M3 的通用插件,而是與 M3 一起訓練的 harness,對標 Claude Code。「模型+harness 共同訓練」意味著 agentic workflow 的行為模式在訓練階段就被烤進去,而非在 inference 層打補丁。這個架構選擇的長期效應,比單次跑分難複製。

量子位的第三方實測(數字均引自 brief,非獨立橫評)展示了幾個具體行為特徵:M3 在 agentic loop 中遇到失敗會自我診斷、結果不符就自行調整、全程無人工介入。復現 ICLR 2026 的 Polar Express 論文時,它從等波動條件獨立推導多項式系數,與論文硬編碼數值幾乎完全重疊,走了一遍和原作者相同的數學推導路徑。

另需標注:M3 上線同步調整計費為 Token Plan,引發用戶熱議,官方事後提高週用量上限並對舊用戶維持原設定。定價架構與開發者使用模式的摩擦,在選型時值得列入評估,能力再強,如果計費邏輯對工程師不友善,採用成本就會被低估。

對受眾的具體啟示:如果你正在用 Claude Code 跑 agentic coding,M3 現在值得放進評估清單,不是保證更好,而是「開源替代」第一次不再是明顯次選。如果你在做模型基礎設施,「模型+harness 一起訓練」的模式值得放進架構思考:它改變的是 agentic behavior 的一致性下限,不只是用戶體驗。

開源在 agentic coding 的差距正在收斂,而且開始用「配套工具鏈一起出」的方式加速收斂。這才是 M3 值得認真看一眼的原因。

本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則