DeltaMedia
2026-09-10
模型動態

GPT-6 Astra 憑什麼暴衝?拆解 Looped Transformer 與隱藏思維鏈的推理謎團

上週,OpenAI 發布 GPT-6 Astra,ARC-AGI-3 得分達 99.9%,前代 GPT-5.6 Sol 同基準測試集只有 7.8%;3D 算圖、數學與程式碼任務的進步幅度格外突出

GPT-6 Astra 憑什麼暴衝?拆解 Looped Transformer 與隱藏思維鏈的推理謎團

重點摘要

  • 上週,OpenAI 發布 GPT-6 Astra,ARC-AGI-3 得分達 99.9%,前代 GPT-5.6 Sol 同基準測試集只有 7.8%;3D 算圖、數學與程式碼任務的進步幅度格外突出
  • Astra 背後傳聞採用「looped transformer(循環式 Transformer)/ recurrent depth(遞迴深度)」架構,讓同一組參數反覆迭代,以較少的新增參數換取更深的有效計算,理論上能在難題上執行更多推理步驟
  • 「Astra 隱藏推理鏈」的傳聞涉及兩個不同層次:架構本身的迭代向量狀態從來不輸出 token,以及產品層面選擇不顯示可讀的思考步驟;兩者的技術邊界,目前外界難以從外部確認

上週,OpenAI 正式發布 GPT-6 Astra,在 AI 工程師社群掀起一波討論。這個模型在幾乎所有主流基準測試上都超越前代 GPT-5.6,進步幅度在特定任務上格外突出,尤其是 3D 算圖與動畫這類圖形任務,以及數學和程式碼生成。ARC-AGI-3 基準測試集的成績最具戲劇性:Astra 拿下 99.9%,前代 GPT-5.6 Sol 只有 7.8%。與此同時,業界對 Astra 架構的技術猜測也在社群持續發酵,主要集中在 looped transformer、遞迴深度與隱藏思維鏈幾個方向上。

GPT-6 Astra 的效能躍升引發業界對其「循環式 Transformer」與「遞迴深度」架構的技術猜想,然而在推理能力顯著提升的背後,隱藏推理鏈所帶來的可解釋性缺失與安全審計挑戰,正成為工程部署上面臨的全新隱憂。

Astra 的基準測試表現:數字背後的意義

先把幾個關鍵數字放在座標上。ARC-AGI-3 是結合邏輯謎題推理與類比泛化的基準測試集,GPT-5.6 Sol 的 7.8% 意味著前代模型在這類任務上幾乎沒有能力,Astra 的 99.9% 幾乎是跨越了整道牆。但這個數字要小心解讀:ARC-AGI-3 旨在測量「類人泛化」,有特定的設計假設,高分不等於通用推理能力達到人類水準,只代表模型在這個測試框架下幾乎零失誤。

更貼近真實場景的測試是 Artificial Analysis Coding Agent Index v1.4,這個指標混合了多種代理程式碼任務。Astra 在這裡確實位居前沿,但並沒有大幅甩開競爭對手,整體的 Artificial Analysis Intelligence Index(融合多類型任務)也呈現類似的趨勢。這個結果說明什麼?AI 模型整體的程式碼能力差距正在縮小,在複雜代理任務上,領先者的優勢遠比在封閉基準測試上窄。

Astra 在圖形任務上的突出表現是另一條有意思的線索。3D 算圖和動畫生成需要空間推理、幾何一致性與步驟正確性同時成立,這類任務對中間推理品質的要求比純文字生成高得多。如果 Astra 在圖形任務上的進步幅度確實高於其他類別,循環深度的假說就更值得認真對待,因為多輪迭代精煉的計算方式,最能幫到需要步驟正確性的任務。這條線索把我們帶到架構問題上。

Looped Transformer 是什麼,和傳統架構差在哪

傳統 Transformer 的計算方式是「單次前向傳播」(single forward pass):輸入 token 進去,依序通過 N 層 attention 和 feed-forward block,然後輸出結果。每一層的參數各自獨立,計算路徑固定,不能回頭。要加深推理,幾乎只有堆更多層這個辦法。每一層需要自己的參數,成本線性增長。

Looped transformer / recurrent depth 的核心是讓同一組 transformer block 重複執行多次,每次把上一輪的輸出再送回同一組參數繼續計算。從計算效果看,這像是深度為 N×K 的網路(N 是 block 組數,K 是迭代次數);但參數量只需要覆蓋那 N 組 block,不會因為迭代次數增加而線性成長。這個方向在機器學習研究中不是新構想,「深度遞迴」由來已久,各種實作方案主要差在如何處理迭代之間的狀態傳遞,以及何時判斷計算已收斂。

為什麼這個架構對推理能力有幫助?讓模型對同一個問題「思考」多輪,每一輪都在前一輪的基礎上精煉,比強迫一次得出答案更能處理多步驟問題。數學推導、幾何推理、長程程式邏輯,這幾類任務的共同特點是「中間步驟的正確性會影響後續所有步驟」,正好是迭代精煉最能發揮的場景,這也和 Astra 在數學與 3D 圖形上格外突出的基準測試表現互相印證。不過需要加上推論語氣:OpenAI 尚未正式確認 Astra 的完整架構細節,目前的說法主要來自業界觀察與傳聞。

還有一個值得注意的特性:迭代次數可以動態調整。簡單問題可能較少輪次就收斂,複雜問題可能需要更多輪,這也實踐了「簡單題快答、難題多想幾步」的直覺行為。但工程師要注意這個權衡:迭代次數越多,推理延遲越高,在延遲敏感的應用場景,遞迴深度架構會拖慢速度。

「隱藏推理鏈」是架構特性還是產品選擇

這是整件事最容易混淆的地方,需要把兩件事拆開來看。

如果 Astra 採用遞迴深度架構,它的中間迭代狀態從一開始就不是 token,而是向量空間裡的浮動數值。這些中間狀態本來就無法輸出成可讀文字,不是「可以給使用者看但選擇藏起來」,而是根本沒有可讀版本。這是架構本身的特性,談不上「隱藏」。

相較之下,若 Astra 同時有類似思維鏈的機制,也就是在輸出最終答案之前先生成一段可讀的推理步驟,但 OpenAI 選擇不把這段步驟顯示給使用者,那是另一件事,是明確的產品決策。這兩種機制技術上可以並存:模型可以既有架構層面的迭代深度(本質上不可見),也有產品層面選擇不顯示的推理 token(可生成但不輸出)。

Astra 傳聞中的「隱藏推理鏈」,從傳聞描述的方式來看,比較接近第二種,也就是模型有可讀的中間推理步驟,但 OpenAI 沒有把它顯示出來。問題是:如果兩種機制同時存在,外部研究者要解讀 Astra 的推理過程,就需要同時處理兩個不同層次的表示,一層在架構的向量迭代裡,另一層在隱藏的 token 序列裡,現有工具和方法論都還沒跟上這個複雜度。

對可解釋性與安全的真實風險

從架構層面看,遞迴深度讓模型內部計算的不透明性增加了一個維度。傳統 Transformer 的注意力機制圖譜(attention pattern)是可以分析的,研究者可以看哪些 token 在哪一層對哪些 token 施加注意力。但如果同一組參數被迭代多次,早期迭代的狀態會影響晚期迭代的注意力分布,這種時序依賴讓靜態分析工具的效用大打折扣。理論上,遞迴深度越深的模型,越難用現有工具解釋它在做什麼。

隱藏思維鏈帶來的安全問題更直接。如果模型在生成最終答案前執行了不可見的推理步驟,這個步驟的內容是什麼?它有沒有可能和最終輸出不一致?有沒有可能在隱藏步驟裡處理了敏感資訊,卻在最終輸出裡表現得沒事一樣?

對部署端的工程師來說,這是個具體的系統設計問題:當你把 Astra 接進代理任務流程,模型的中間推理對你完全不透明。如果任務涉及需要審計的決策,或者你需要確認模型沒有繞過你設下的防護欄(guardrail),提示詞(prompt)層面的控制可能不夠,因為你控制的是輸入和輸出,而遞迴深度的計算發生在中間,是你看不到、也干預不了的位置。Astra 的基準測試數字評測的是輸出品質,不是中間推理的對齊程度,ARC-AGI-3 的 99.9% 告訴你它在這個測試集上幾乎不犯錯,但不告訴你它為什麼不犯錯,也不告訴你它在什麼情況下、以什麼方式會犯錯。

接下來幾個月,如果 looped transformer 的技術細節在論文層面陸續公開,評估架構可解釋性工具能否跟上,以及 OpenAI 是否提供更多關於隱藏推理步驟的觀察介面,比繼續盯著基準測試分數更值得工程師的注意。推理能力與可觀察性之間的落差,才是這場架構升級最需要追蹤的關鍵。

常見問題

Looped transformer 和傳統 Transformer 最大的差別是什麼?
傳統 Transformer 讓輸入一次通過固定數量的獨立層,每層有自己的參數。Looped transformer 讓同一組參數重複執行多次,每次把上一輪輸出再送回繼續計算,效果像是更深的網路,但參數量不會因迭代次數增加而線性成長。

Astra 的「隱藏推理」是架構特性還是 OpenAI 的選擇?
很可能兩者同時存在。遞迴深度架構的中間迭代狀態本就是向量,根本沒有可讀版本,這是架構特性;如果 Astra 同時有可讀的思考步驟而選擇不顯示,那是產品決策。OpenAI 尚未正式說明架構細節,兩者的邊界難以從外部確認。

ARC-AGI-3 的 99.9% 代表 Astra 已達通用人工智慧水準嗎?
不代表。ARC-AGI-3 測量特定框架下的邏輯謎題推理與類比泛化,高分只代表模型在這個測試集上幾乎無失誤。更接近真實場景的 Artificial Analysis Coding Agent Index 顯示,Astra 雖位居前沿,但並沒有大幅拉開差距。

相關公司 OpenAI
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則