Agent與應用
共 42 篇 · 第 2/2 頁
-
Microsoft Agent Governance Toolkit 強制接管每個 tool call,prompt 安全 26.67% 失敗率催生 runtime 硬攔截
Microsoft 釋出 Agent Governance Toolkit,將 AI agent 安全管控從 prompt 層移至應用層:每個 tool call 與 agent 訊息在發出前先過政策引擎審查,預設拒絕任何出錯狀況。根據釋出資訊,純靠 prompt 要求 agent 守規矩的失敗率達 26.67%,To
-
開源 Agent Swarm 上線:Opus 4.8 規劃、Deepseek 執行,agentic loop 成本砍十倍
一套開源 AI agent swarm 框架正式上線,核心設計是分層模型路由:強模型負責規劃、輕量模型負責執行。與全程使用 Opus 4.8 相比,成本降低十倍,速度提升兩倍,效果相當。
-
騰訊混元聯手港中文與清華推出 PhoneHarness,手機 agent 評測從「預測畫面」升級為「驗證實效」
騰訊混元研究團隊聯合香港中文大學與清華大學,發布手機 agent 測試框架 PhoneHarness。這套框架的核心轉向:不再只問「預測下一個畫面對不對」,而是問「任務有沒有真的完成」。實測結果顯示 75% 通過率,比所有未採用 PhoneHarness 設定的方案高出 12.9 個百分點。
-
RL 環境就是你的數據生成器,它壞掉,你的模型就壞掉
post-training 的競賽愈演愈烈,各家團隊爭相用強化學習(RL)把 base model 打磨成能幹活的 subagent。在這個過程中,有一個基礎設施層幾乎被低估到忽視:training harness,也就是 RL agent 真正生活在其中、與之互動、靠它獲得回饋的那套模擬軟體系統。它可以是一個模擬聊天
-
dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%
衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。多組新評測在同期集中浮現,共同指向這個方向,而在最難一檔任務上,目前 agent 的平均全通過率僅 2.6%。
-
NVIDIA Nemotron 3 Ultra:開放權重新座標,與一場低精度預訓練的規模跳躍
開源模型與閉源前沿的差距,一直是做 agent 系統的團隊繞不開的成本題。NVIDIA 這次發布 Nemotron 3 Ultra,給這道題打進了一個新的刻度。
-
姚順雨的「下半場」:瓶頸從找方法移到找問題,三個訊號看頭部怎麼押注
這場對談發生在一個尷尬時間點:外界持續質疑騰訊 AI 是否落後,姚順雨選在此時公開定義他的框架。剝掉大會包裝,對建構者真正有用的是以下幾層邏輯。
-
Qwen 3.6 35B 翻案:實測揭示 KV Cache 壓縮才是 Agent 任務的隱性瓶頸
一位 LocalLLaMA 開發者在 Rivet 子圖除錯中卡關兩天、因 context overflow 反覆觸發量化降級後,改用 Qwen 3.6 35B IQ4NXL 搭配未壓縮 KV cache,問題幾乎一次解決。實測對比顯示:35B IQ4NXL(KV 未壓縮)表現超越原本日常主力 Qwen 27B Q5KX
-
形式化不是吃苦藥,Axiom 對 AGI 路徑的反主流判斷
2025 年,成立僅七個月的 Axiom 在 Putnam 數學競賽解出全部 12 題(限時內完成 8 題),優於頂尖大學生的 110/120 分、DeepSeek 據報的 103/120 分。Putnam 歷屆中位數通常是 0 到 1 分,這份成績單並非不值一提。但與其把它讀成「AI 又破了一道難關」,不如把它當成
-
GitLab 營收漲 23% 仍砍 14% 員工,CEO「agentic era」轉型被市場一日打臉
GitLab 在 Q1 財報超預期的當天同步宣布裁員約 350 人(佔全員近 14%),並退出 22 個國家及地區。本季營收 2.642 億美元、年增 23%,超出分析師預期的 2.54 億;財報發布後盤後股價一度漲 7%,但次日開盤消化裁員消息後,漲幅全數回吐。
-
Gemini Spark 把旅程規劃 agent 推入消費日常,也把授權風險推上討論桌
The Verge 刊出一篇 Gemini Spark 的主觀實測,測試場景鎖定旅程安排(trip planning);記者以「最驚艷也最恐怖的 AI 體驗」為標題總結感受,罕見地在同一評語中並陳能力肯定與風險示警。需注意:這是單一媒體的個人實測,brief 僅含標題,產品細節無從外推。
-
競爭已從模型跑分蔓延到 IPO 時間表:Anthropic S-1 背後的三條線索
6 月 1 日,Anthropic 向 SEC 秘密遞交 Form S-1 草案,同日宣布完成 650 億美元 Series H 融資,投後估值達 9,650 億美元。股份數量與發行價格尚未確定,後續視 SEC 審查進度而定。
-
Pollen Robotics 替 Reachy Mini 引入遠端 MCP 工具,打破「每個工具都得是本地 Python」的硬限制
Pollen Robotics 在 Reachy Mini 對話應用中新增第三類工具,遠端 MCP 工具,讓機器人能在不修改本地 app 的前提下,直接調用發布在 Hugging Face Space 上的外部能力。過去所有工具都是本地 Python,搜尋、天氣、查詢這類無狀態能力也得打包進 app,形成不必要的摩擦。
-
OpenAI 模型與 Codex 登陸 AWS,分發層邏輯正在改寫
OpenAI 的 frontier 模型與 Codex 現已可在 AWS 上直接取用。這個動作的真正訊號不是「又多一個雲端入口」,而是模型供應商主動把自己鋪進企業既有的雲端工作負載裡,過去雲廠商靠「自家模型優先」築牆的邏輯正在鬆動。對已在 AWS 上架設 agent 或 coding pipeline 的團隊,最直接的
-
醫療缺口達千萬,Agentic AI 能否真正補上那道裂縫
全球醫療體系正面臨一場慢性崩潰。數十年的投資不足與招募困境,撞上老齡化人口帶來的需求爆炸,讓這個矛盾無所遁形。世界衛生組織(WHO)警告,醫療人力缺口到 2030 年將擴大至 1,100 萬人。這不是遠期預測,而是已在進行中的事實:照護資源碎片化、第一線醫護人員的職業倦怠持續攀升。在這個背景下,具備自主決策與行動能力的
-
開源 Agentic Coding 的差距正在收斂,M3 的真正訊號不是跑分
MiniMax M3 最值得認真看的,不是 SWE-Bench Pro 的 59%,雖然這個數字超過 GPT-5.5 和 Gemini 3.1 Pro、接近 Opus 4.7 確實夠硬。真正的訊號是:它是國內第一個把長上下文、多模態、Coding 三件事同時做到的開源模型。缺少任何一條,agentic 任務就會在中途卡
-
憑證不進 sandbox,就無法外洩:拆解 Anthropic 跨產品的沙箱架構
多數沙箱產品的通病是文件含糊,讓使用者根本無從判斷該給它多少信任。Anthropic 最近公開了一份少見的詳細說明,把 Claude.ai、Claude Code 和 Cowork 三個產品各自怎麼做隔離說清楚了。對於正在自建 agent 的工程師,這份文件的含金量不在於「學 Anthropic 跟進」,而在於它把幾個
-
Anthropic 的雙重翻盤:估值是煙火,Agent 編排才是結構變局
去年 12 月,Anthropic 的年化營收是 $9B。五個月後,這個數字跳到 $47B。同步完成的 $65B Series H 讓其估值達到 $965B post-money,投資人涵蓋 Altimeter、Dragoneer、Greenoaks、Sequoia,以及包含 Amazon 在內的主要雲端業者。