NVIDIA Nemotron 3 Ultra:開放權重新座標,與一場低精度預訓練的規模跳躍
開源模型與閉源前沿的差距,一直是做 agent 系統的團隊繞不開的成本題。
開源模型與閉源前沿的差距,一直是做 agent 系統的團隊繞不開的成本題。NVIDIA 這次發布 Nemotron 3 Ultra,給這道題打進了一個新的刻度。
模型配置是 550B MoE、55B 活躍參數、百萬 context 視窗,架構融合 hybrid Mamba/attention、LatentMoE 與 native MTP,權重、合成資料、獎勵 checkpoint、量化版本與訓練配方一併以 OpenMDW 1.1 開放。ArtificialAnalysis 以 NVFP4 推理權重量到 Intelligence Index 47.7(BF16 版本 48.2),在其測過的美國開放權重模型中目前排名最強,但仍落後 Kimi K2.6。這個座標本身值得記下:美中開源差距確實存在,且現在有具體數字可以量。
真正值得做架構的人停下來看的,是預訓練這層。NVFP4 在 20 兆 tokens 規模上完成預訓練,技術意義超過分數本身。低精度預訓練並不新鮮,但在這個參數量與資料規模下落地,這意味著訓練基礎設施的計算效率進入了新的量級。這套方法若能被社群廣泛驗證,可能影響的不只是 NVIDIA 自己的下一代訓練。
商業敘事上,NVIDIA 宣稱 Nemotron 3 Ultra 在 agentic 任務上最多快達 5 倍、成本低 30%,BlackBox 回報吞吐量超過每秒 400 tokens。需要指出的是,這些數字目前來自 brief 引述的官方與第三方說法,尚未經獨立廣泛驗證。發布當天即鋪滿 vLLM、Together、Fireworks、Ollama、Baseten 等整條 serving stack,這種 day-0 生態覆蓋是刻意為之:開放模型若推理成本沒人能輕鬆複現,開放本身的意義大打折扣。
對做 agent 系統的團隊,這把尺的讀數是:開放權重正從「能跑」走向「為長程 agent 與低精度經濟性而生」。Nemotron 3 Ultra 的出現不代表你明天就該搬遷閉源 API,但它確實讓「我們評估過開放替代方案的 TCO 嗎」這個問題,在下一次架構討論中更難被跳過。

