DeltaMedia
2026-07-21
Agent與應用

Agent 能力的 scaling 規律:字節跳動 38,000 小時實驗揭示了什麼

字節跳動在 134 個真實世界任務上累積了 38,000 小時的 agent 運行資料,五個前沿模型的進展幾乎完美落在同一條數學曲線上(2026 年 7 月 4 日)

Agent 能力的 scaling 規律:字節跳動 38,000 小時實驗揭示了什麼

重點摘要

  • 字節跳動在 134 個真實世界任務上累積了 38,000 小時的 agent 運行資料,五個前沿模型的進展幾乎完美落在同一條數學曲線上(2026 年 7 月 4 日)
  • 跨會話保留記憶的 agent 大幅勝過每次重啟的版本,顯示持久狀態對任務效能的影響,可能比底層模型版本的差異更關鍵
  • 字節跳動的實驗指出 agent 學習速度每三個月翻一倍,此為單一實驗室結果,尚待第三方複現

2026 年 7 月 4 日,字節跳動公開了一批 AI agent 實驗資料:他們在 134 個真實任務上累積了 38,000 小時的運行時間,任務範圍從重力波偵測到 CPU 設計。這不是合成 benchmark,而是讓 agent 去做那些有明確答案但過程高度開放的工程與科學工作。他們進一步把五個前沿模型的進展畫在同一張圖上,發現一條乾淨的數學曲線幾乎完美擬合了所有資料點。

一條數學曲線怎麼擬合五個前沿模型的進展?

AI 能力能不能預測,長期以來各界說法分歧。字節跳動這次的設計之所以引人注目,在於他們跑的不是合成場景,而是重力波訊號分析、CPU 電路設計這類複雜度夠高、能真正拉開模型差距的任務。

五個前沿模型的表現資料點落在同一個座標系裡,進展軌跡都貼著同一條曲線走。在 LLM 訓練的 scaling law 研究裡,這類規律並不陌生,但能在 agentic 場景中出現,推論上意味著這條規律的適用範圍比想像中更廣。如果 agent 能力的成長曲線是可外推的,產品規劃就有了一個實際的依據:能力提升的節奏是可以預測的,不必等下一個模型版本發布才知道走向。

當然,這個結論需要保留。字節跳動用的是自己定義的五個模型與 134 個任務,曲線擬合得漂亮,不代表換一組任務或換一批模型還能成立。這個結果能不能被複現,是判斷它能否成為通則的唯一標準。

帶記憶的 agent 比重啟版本好在哪裡?

38,000 小時實驗的另一個關鍵發現更直接:跨會話保留記憶的 agent,表現大幅勝過每次重啟的版本。字節跳動的公開資料裡沒有給出具體的量化差距,但這個方向本身足以改變工程的優先排序。

直觀的原因符合人的學習邏輯。工程師解第二個類似 bug 比第一個快,不是因為大腦換了更好的版本,而是前一次的經驗還在。agent 每次重啟,等於從空白記憶重新開始,就算底層模型的推理能力再強,在需要累積上下文的任務上還是吃虧。

這個發現逼得大家正面對決架構問題:持久狀態直接決定 agent 在複雜多步驟任務上能不能累積出工作成效。過去多數 LLM 產品把精力放在提升單次 prompt 的輸出品質,更長的 context window、更精細的 system prompt 設計。但如果跨會話記憶對任務效能的影響大過底層模型版本的差異,這條工程路線的邊際效益就值得重新計算了。

「每三個月翻倍」這個數字站得住腳嗎?

字節跳動的實驗還提出了一個數字:agent 的學習速度每三個月翻一倍。這個說法類似 LLM 訓練效率的成長曲線,但套用在 agent 於任務上的進步速率,是更激進的宣稱。

如果這個翻倍週期在接下來幾個季度仍然成立,理論上三個月後的 agent 在相同任務集上的表現應該是現在的兩倍。對產品規劃的含義很具體:若以一年為周期設計路線,agent 能力的拐點可能在週期中段就到,等到年底再調整就慢了。

這裡要先說清楚:「每三個月翻倍」是字節跳動自己的觀察口徑,從他們的 38,000 小時資料中導出。目前沒有獨立機構在相同任務集上複現這個結論,我們能確認的是「這是他們的實驗結果」,這個數字是否具有普遍性,還需要更多來源的資料來驗證。

對工程師的具體啟示是什麼?

從這批實驗資料裡,有一個工程方向比較清楚:把跨會話記憶從「optional feature」升格為架構設計的關鍵決策。字節跳動選擇在重力波偵測、CPU 設計這類長週期、多步驟的任務上讓 agent 長時間連續運行,這個設計本身就暗示,有些工作不適合切成一次性的 prompt 呼叫,而需要 agent 在數十乃至數百個步驟裡保持連貫的記憶與學習累積。

agent framework 若還把持久記憶當作附加模組,可能需要重新考慮這個選擇。記憶架構不是之後可以補的東西,如果帶記憶的 agent 大幅勝過重啟版本這個結果成立,它就是能力的基礎條件。

這批資料本身是單一實驗室的結果,曲線與翻倍數字都等待外部複現。但它提供了一個有數據支撐的理由,讓「把工程重心從單次 prompt 移到跨會話記憶」這個方向說得出口。下一個值得解的問題,可能不是等更好的模型,而是設計一個讓 agent 的經驗不隨會話結束而消失的架構。前者靠外部進展,後者是自己可以主動做的事。

相關公司 ByteDance
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則