DeltaMedia
2026-07-22
← 所有故事線 Agent與應用

Meta

5 則 · 41 天(2026-06-04 ~ 2026-07-15)

  1. 2026-07-15 造出 agent 不再是主戲:2026 年 AI 工程重心已移轉
    造出 agent 不再是主戲:2026 年 AI 工程重心已移轉

    2026 年 7 月的 AI Engineer World's Fair 上,AutoGPT 等 2023 年指標性的自主代理人專案幾乎無人提及,取而代之的是 Claude Code、Codex、Gemini CLI、Cursor 等以系統可靠性為核心的工具。

  2. 2026-06-12 答題學霸不等於干活能手:Agents' Last Exam 讓 Fable 5 輸給 GPT-5.5
    答題學霸不等於干活能手:Agents' Last Exam 讓 Fable 5 輸給 GPT-5.5

    2026 年 6 月 12 日,UC Berkeley 發布 ALE(Agents' Last Exam)基準,要求 AI agent 在 Siemens NX、Unreal Engine、Adobe After Effects 等真實軟體裡複製人類領域專家已完成的任務;冠軍 GPT-5.5 + Codex 通過率 2

  3. 2026-06-08 OpenEnv:開源 AI Agent 訓練缺的那層基建
    OpenEnv:開源 AI Agent 訓練缺的那層基建

    當前 AI agent 訓練的競爭,正從單純的模型能力比拼,移向 harness 與模型的協同優化。Claude Code、Codex、OpenClaw、Hermes 這類 agent harness 持續進步,背後的關鍵之一是:前沿實驗室的模型與自家 harness 一起訓練,GPT-5.5 和 Opus 4.8 都

  4. 2026-06-06 dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%
    dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%

    衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。多組新評測在同期集中浮現,共同指向這個方向,而在最難一檔任務上,目前 agent 的平均全通過率僅 2.6%。

  5. 2026-06-04 GitLab 營收漲 23% 仍砍 14% 員工,CEO「agentic era」轉型被市場一日打臉
    GitLab 營收漲 23% 仍砍 14% 員工,CEO「agentic era」轉型被市場一日打臉

    GitLab 在 Q1 財報超預期的當天同步宣布裁員約 350 人(佔全員近 14%),並退出 22 個國家及地區。本季營收 2.642 億美元、年增 23%,超出分析師預期的 2.54 億;財報發布後盤後股價一度漲 7%,但次日開盤消化裁員消息後,漲幅全數回吐。