DeltaMedia
2026-07-21
開源生態

單晶片撐不住 AI 推理!「超節點」強勢崛起成基建新戰場

2026 年 7 月 17 日,月之暗面發布 Kimi K3,Text Arena 排名從第 38 名躍至第 9,48 小時後因用量逼近集群上限,被迫於 7 月 19 日暫停 C 端新使用者訂閱。

單晶片撐不住 AI 推理!「超節點」強勢崛起成基建新戰場

重點摘要

  • 2026 年 7 月 17 日,月之暗面發布 Kimi K3,Text Arena 排名從第 38 名躍至第 9,48 小時後因用量逼近集群上限,被迫於 7 月 19 日暫停 C 端新使用者訂閱。
  • K3 官方建議至少 64 顆高效能晶片組成超節點環境才能正常部署;華為昇騰 950 超節點最高支援 1024 卡,提供 1 EFLOPS FP8 算力與 256 TB 統一記憶體定址空間。
  • AI 高速互聯市場預估 2025 至 2030 年年複合成長率約 23.9%,高於同期傳統資料中心網路的 17.6%。

7 月 17 日,月之暗面發布 Kimi K3,在 Text Arena 綜合排行榜拿到 1486 分、全球第 9,一口氣從 K2.6 的第 38 名跳升 29 個名次,成為首個進入全球前十的開源模型。前端程式 (Frontend Code Arena) 榜單上,K3 以 1679 分超越 Claude Fable 5 登頂,7 個細分方向拿下其中 6 個第一。然而 48 小時後,月之暗面宣布暫停 C 端新使用者訂閱,理由是用量已逼近集群承載上限。排名突破的那一刻,反而逼出最真實的算力缺口。

當大模型推理需求逼近單晶片物理極限,AI 基礎設施的競爭已從單卡算力比拼,轉向以「超節點」為核心的高速互聯系統整合戰。

超節點是什麼?為什麼推理需求讓單芯片不夠用?

超節點,是把數百乃至數千顆 AI 加速晶片透過高速、低延遲的 Scale-up 互聯,整合成單一邏輯運算單元的高密度算力系統。對應用層來說它是一個節點,但裡面可能有數百至千顆晶片協同運作。這個「邏輯上的單一」不只是行銷說法,而是有具體架構意義:系統對外提供統一的記憶體定址空間,程式不需要顯式管理跨卡資料搬移。

K3 的技術參數說明了為什麼推理時代需要這種架構。K3 總參數 2.8 兆,採用 Stable LatentMoE 架構,896 個專家中每個 token 只激活 16 個,稀疏程度極高。稀疏 MoE 的效率優勢有個前提條件:所有 896 個專家的參數必須同時放在可快速存取的位置,因為模型在生成每個 token 前無法預知要調用哪 16 個。理論上,單張晶片的 HBM 容量不足以容納如此規模的參數集,跨卡的統一記憶體定址因此從「錦上添花」變成「不可或缺」。這不是外部推算,K3 官方直接挑明,至少要拿 64 顆高效能晶片組成超節點,才夠格談正常部署。

華為在 2026 年世界人工智慧大會 (WAIC) 上首次公開昇騰 950 超節點真機:最高支援 1024 卡部署,提供 1 EFLOPS(每秒 10 的 18 次方次浮點運算)的 FP8 算力,以及 256 TB 的統一記憶體定址空間。256 TB 的統一定址讓整套系統對應用層呈現為一個連續的記憶體池,大參數量模型的推理排程在軟體層得以大幅簡化。這個規格方向和 K3 的 64 卡低消指向同一個事實:現在決定推理服務好壞的關鍵是系統整合能力,而不是單張晶片的峰值算力。

為什麼互聯的速度和延遲,比晶片峰值算力更關鍵?

超節點的瓶頸不是晶片堆得夠不夠多,而是晶片之間能不能順暢溝通。推理場景的自迴歸生成,每產出一個 token,注意力機制都需要存取之前所有 token 的鍵值快取。當鍵值快取分散在數百至數千顆晶片上,跨卡通訊的延遲直接決定每個 token 的生成速度。Scale-up 互聯要做的,是把這個跨卡通訊代價壓到讓整套系統的延遲體驗盡量接近單顆超大晶片。

市場資料反映了這個方向的投資邏輯。Research and Markets 預估 AI 高速互聯市場將從 2025 年的 103.1 億美元成長至 2030 年的 301.7 億美元,年複合成長率 23.9%;BCC Research 同期對整體資料中心網路技術市場的預估是 458 億美元成長至 1030 億美元,年複合成長率約 17.6%。兩者相差約 6 個百分點,代表資本市場看好 AI 算力對互聯的需求,會跑得比傳統資料中心網路擴建還要快。

月之暗面在暫停訂閱的公告裡用的詞是「集群承載上限」,而非「伺服器容量不足」。字眼差一點點,意思卻差很多,這代表系統整體的並行承載能力才是超節點架構要解決的硬骨頭。月之暗面宣布「全力推進算力擴容」,也等於承認接下來不能只靠無腦加機器,得想辦法拉高系統整體的服務能力。

開源模型效率追上來了,AI 硬體需求還會繼續成長嗎?

K3 發布後,市場上一場持續已久的辯論再次升溫:更高效的模型,是否意味著硬體需求的頂點已過?Stanford AI Index 2026 的資料顯示,截至今年 3 月,頂尖閉源模型相對頂尖開源模型的領先幅度縮小至約 3.3%;Epoch AI 的研究則顯示,最強開放權重模型平均落後最強閉源模型約 4 個月。開源的追趕速度確實已不容忽視。

但 Meritz 證券在 7 月 19 日的報告裡做了一個關鍵切割:DeepSeek 打出的是 600 萬美元極低訓練成本的論點,暗示效率可以取代規模;K3 沒有揭露訓練成本,且官方給出的部署門檻是至少 64 顆晶片的超節點環境,兩者的算力邏輯並不相同。從使用成本看,K3 每次任務處理費約 0.95 美元,與 GPT-5.6 Sol 的 1.04 美元接近,Claude Fable 5 則高達 2.75 美元。K3 的定位更接近「高能力、合理成本」,而非「極低成本」。

花旗分析師把 K3 視為「杰文斯悖論 (Jevons Paradox)」的潛在案例:技術效率讓單位成本下降,往往引發使用量大幅擴張,資源總消耗不降反升。Silicon Data 的 LLM Token Expenditure Index 自 6 月起持續回落,看起來像是降溫訊號,但 OpenRouter 的資料顯示截至 7 月 6 日全球週調用量已達 52.6 兆 token,整體規模仍在高位。兩個指標同時存在並不矛盾:單位成本在降,但總使用規模仍在攀升。美銀證券的評估也指向同一方向,若中國開源模型持續逼近前沿,美國頂尖實驗室更可能增加算力投入,而非縮減,以維持差距。

超節點的規格數字,需要打幾折看?

超節點的技術方向明確,但有三個變量目前仍難以量化。

昇騰 950 超節點的 1 EFLOPS 與 256 TB 是廠商公布的理論峰值。實際部署場景中,有效算力受互聯頻寬的實際吞吐、軟體排程效率、散熱設計,以及工作負載類型等多重因素影響。這個落差目前無法由外部獨立驗證,不是針對特定廠商的質疑,而是所有超節點廠商在規格競賽中共同面對的可信度問題。

軟體框架的成熟度是第二個變量。超節點的硬體優勢需要配套的分散式推理框架才能兌現,包括千卡規模下的最佳化支援、模型平行切割策略,以及鍵值快取的跨卡管理機制。這類工程經驗沒辦法速成,如果開發者不用原廠軟體棧,目前看來還是很難跨過這個門檻。

第三個變量是採用曲線本身。64 卡超節點對多數中小型部署者而言是很高的進入成本,如果實際市場中大量部署是以單機或小集群方式跑 K3,實際效能將低於官方資料。這可能影響開發者對超節點必要性的判斷,也可能讓互聯市場的實際成長速度落後 23.9% 的預估曲線。

K3 的「算力熔斷」提供了一個有用的座標:模型效率提升帶來的使用量增長,目前看來比它節省的算力更多;系統整合能力(而非單卡峰值算力)正快速成為決定服務品質的關鍵。接下來的觀察指標,在於主流推理框架能不能成熟支援千卡規模,以及超節點在中小型部署場景的成本能不能降下來。

常見問題

超節點跟傳統 GPU 集群有什麼本質差異?
傳統 GPU 集群靠 Scale-out 方式以一般網路協定連接多台伺服器,節點間通訊延遲相對較高。超節點的核心是 Scale-up 互聯,在同一系統內以高速專用通道連接數百乃至數千顆晶片,對外呈現為單一邏輯運算單元,讓統一記憶體定址成為可能,程式不需要顯式處理跨卡通訊邏輯,這是兩者在架構層面的根本差異。

Kimi K3 的「算力熔斷」代表月之暗面基建規模不夠大嗎?
不完全是。熔斷反映的是需求超出預估的速度,而非絕對規模不足。月之暗面公告說明用量逼近集群承載上限後即刻啟動擴容,問題在於市場需求的峰值比規劃走得更快,這在開源模型排名突破帶動大量新使用者湧入的場景下是可預期的情況。

AI 高速互聯市場的 23.9% 年複合成長率,比傳統資料中心網路高出這麼多,差距從哪裡來?
差距主要來自 AI 推理工作負載對延遲的敏感度,遠高於傳統資料中心應用。超節點場景要求晶片間通訊延遲必須低到足以讓整套系統行為接近單顆晶片,這推動了對高速互聯專用硬體的需求,而這塊在傳統資料中心網路投資裡幾乎不存在。23.9% 可以當作方向性指標,與 17.6% 的相對差距比絕對數字更值得關注。

相關公司 Anthropic Moonshot
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則