DeltaMedia
2026-07-21
模型動態

SkillOpt:當 Prompt 工程變成 Prompt 訓練

Agent 的 skill 文件是一個奇怪的存在。

SkillOpt:當 Prompt 工程變成 Prompt 訓練

Agent 的 skill 文件是一個奇怪的存在。它決定了模型在特定任務上的行為,卻幾乎總是人工寫死後就再也不動。工程師花時間調它、上線後就凍結。問題在於:執行軌跡裡藏著大量失敗訊號,從來沒有人有系統地把它讀回來。

Microsoft Research 的 SkillOpt 正是為了解決這個問題。它的核心思路是把 skill 文件重新定義,不是靜態文檔,而是「凍結 agent 的可訓練狀態」。這個比喻很精準:就像神經網路的權重在推論時固定、在訓練時可調,skill 文件在執行時不動,但在迭代週期可以被系統性地修改。

具體機制如下:一個獨立的第二模型讀取 agent 的執行軌跡,分析哪些步驟有效、哪些失敗,然後提出針對 skill 文件的小幅編輯,可以是新增、刪除或替換特定片段。這裡的關鍵字是「小幅」:每輪都有 edit budget 限制,對應梯度下降裡學習率的角色;太大的改動等同於學習率爆炸,容易覆蓋掉已有的好行為。

評審機制則借鑒了嚴格的評估紀律。候選版本必須在 held-out set 上打敗前一版才能上線;被拒絕的變更則作為負信號回饋,讓系統知道那個方向走不通。Minibatch 的設計讓每一輪只看部分軌跡,迫使系統抽出真正有泛化價值的模式,而非過擬合到單一執行案例。整體而言,這套流程在結構上與梯度下降訓練高度同構,只是操作對象從浮點數換成了自然語言文本片段。

效果數字來自 brief 的直述:SkillOpt 在六組 benchmark、七個模型上的測試中,52 個設置裡贏出或平手;在某個前沿模型的對話場景提升了 23.5 分,程式碼相關任務則最高增加了 24.8 分。另一個工程細節值得注意:最終輸出的 skill 文件被刻意壓在 2000 token 以內。這不只是省成本,而是強迫系統產出精練的知識而非堆砌內容,一個有意識的設計約束。

對在做 agent 系統的工程師,這裡有幾個值得認真對待的含意。

第一,這把「prompt 工程」推向了「prompt 訓練」的思維框架。兩者的差異不只是工具,而是認識論:工程師不再是靠直覺猜「哪段描述更好」,而是讓執行軌跡說話、用評估集仲裁。這意味著你的 skill 文件需要版本管理和自動化評估,否則迭代就沒有錨點。

第二,second model 作為「編輯者」的角色值得借鑒。很多團隊的 agent 架構已經有 critic 或 verifier,但多數只用來評分,沒有把評分轉化成對 artifact 本身的精確編輯。SkillOpt 的做法是讓 critic 直接寫 diff,讓系統的改善動作更具體、更可追蹤。

第三,2000 token 上限是一個工程選擇,但背後是一個可以借用的原則:如果你的 skill 或 system prompt 越長越難維護,那約束它的大小反而能逼出更高品質的表達。

這套機制目前看來是離線迭代的框架,在每次部署週期之間跑。推測上要做到線上自適應還有距離,但方向是清楚的:agent 的知識庫不應該只由人來更新。

相關公司 Microsoft
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則