dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%
衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。
衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。多組新評測在同期集中浮現,共同指向這個方向,而在最難一檔任務上,目前 agent 的平均全通過率僅 2.6%。
dair_ai 推出 Agents' Last Exam(ALE),收錄 1,000 筆以上任務,依美國職業分類系統對映到具體崗位工作,最高難度層平均全通過率 2.6%。rishi_desai2 同期發布 SWE-Marathon,測試 coding agent 能否在 1B token 預算內保持連貫,任務包括建構 Slack clone、將 JAX 改寫為 PyTorch、從頭實作 C 編譯器。omarsar0 另點名 Meta-Agent Challenge,讓 agent 嘗試自我改進。
三組評測串起一個訊號:SWE-bench 切片式的高分越來越難直接對映到商業可用性,真正的門檻是長程預算下的指令連貫與職業級完整工作。對 agent 開發團隊而言,這意味著評測策略可能需要跟著調整;而 2.6% 的通過率,看起來說明目前大多數 agent 離被企業真正託付,仍有不小距離。
相關公司
Meta
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則
