Agent與應用
共 42 篇 · 第 1/2 頁
Claude Code Desktop 迎來史詩級升級?Anthropic 密謀新介面,要把 AI 寫程式推向雲端自主執行
2026 年 7 月 20 日,社群帳號 testingcatalog 披露,Anthropic 正在為 Claude Code Desktop 加入一個專屬的 Project 建立介面。Enterprise 與 Team 方案使用者建立 Project 時,可為每個 Project 指定 Personal(個人可見)
昨天 · 2 分鐘-
Anthropic 測試 Claude Code 新介面,企業版可選「共享」專案能見度
Anthropic 在 Claude Code Desktop 測試全新專案建立介面,將專案整合至側邊導航並新增頂部模式切換器,強化多工作串管理。
-
造出 agent 不再是主戲:2026 年 AI 工程重心已移轉
2026 年 7 月的 AI Engineer World's Fair 上,AutoGPT 等 2023 年指標性的自主代理人專案幾乎無人提及,取而代之的是 Claude Code、Codex、Gemini CLI、Cursor 等以系統可靠性為核心的工具。
-
Claude Code 讀到 prompt 前先燒 33k token,比 OpenCode 多出 26k:agent 迴圈的每輪固定成本
2026 年 7 月 12 日,一篇在 HN AI 論壇流傳的對比測量顯示,Claude Code 在讀取使用者提示詞之前,已預先傳送約 33,000 個token;OpenCode 在同一環節僅傳送約 7,000 個token。兩者相差 26,000 個token,且這筆開銷在每一輪請求中都是固定支出,不隨對話長短而
-
高盛首度納入評級!看好 SpaceX 狂掃 AI 算力,用火箭級成本優勢稱霸市場
2026 年 7 月 7 日,高盛分析師 Eric Sheridan 以「買入」評級首次覆蓋 SpaceX,目標價 205 美元,估算風險回報比 2:1,三大業務可觸及市場合計 28.5 兆美元。
-
三星 Q2 獲利恐超車 NVIDIA!「一年賺贏 40 年」背後是蘋果在幫忙扛記憶體漲價
三星電子將於 7 月 7 日發布第二季初步財報。30 位分析師預估,三星 Q2 營業利潤將達到 86 兆韓元(約 563 億美元),比去年同期的 4.7 兆韓元大增 17 到 18 倍。若業績達標,這個數字將超越輝達今年第一季 535.36 億美元(折合約 81.8 兆韓元),成為全球科技業單季有史以來最高營業利潤。部
-
Agent 能力的 scaling 規律:字節跳動 38,000 小時實驗揭示了什麼
字節跳動在 134 個真實世界任務上累積了 38,000 小時的 agent 運行資料,五個前沿模型的進展幾乎完美落在同一條數學曲線上(2026 年 7 月 4 日)
-
讓模型自己判斷:Fable 5 的自主性溢價與代價
Anthropic 在 2026 年 7 月 3 日的 AIE 會議與社群討論中,明確建議開發者放手、減少對 Claude Fable 5 的微觀管理,改讓模型自主判斷,好提高寫程式的效率。
-
Condense.chat 開放壓縮代理,Adeline 1 把 settled agent loop 壓到原體積 9%
7 月 3 日,Condense.chat 開放了一個插在 coding AI agent 與底層模型之間的壓縮代理(compression proxy),不改系統提示即可接入,設計目標是直接削減 token 帳單。兩個自研模型各自負責不同的壓縮時機:Helene 1 在 token 進入快取(cache)前率先介入,
-
ASPIRE 拆解:輝達把 Coding Agent 迴圈搬進物理世界,訓練產物從權重變技能庫
2026 年 7 月 1 日,輝達開源 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),機器人任務失敗後,系統自動分析感知、規劃、抓取哪層出問題,把修復經驗寫進持續擴充的技能庫
-
ai-website-cloner-template 衝上 GitHub 20k Star:克隆只是入口,核心是五階段多 Agent + Git worktree 並行流水線
2026 年 6 月 28 日,開源模板 ai-website-cloner-template 在 GitHub 累積 2 萬 Star。一個 URL 丟進去,/clone-website 指令跑完五個階段後,吐出一套可直接執行 npm run dev 的 Next.js 16 + shadcn/ui + Tailwi
-
OpenAI 語音新模型 Bidi 1 測試爆料流出:說話途中可即時插嘴,全雙工互動格局浮上檯面
6 月 23 日,社群帳號 testingcatalog 在 X 上公開一批未經 OpenAI 官方證實的測試紀錄,稱 OpenAI 正開發代號「Bidi 1」的雙向語音模型,能在使用者說話時同步回應,而非等待對方停頓才處理。若爆料屬實,這意味著 ChatGPT 語音互動可能從現行的半雙工(half-duplex)輪流
-
AI Agent 監控的防線沒你想的那麼牢:MonitoringBench 實戰評測
2026 年 6 月 21 日,MonitoringBench 正式公開,收錄 2,644 條成功攻擊軌跡,涵蓋 13 個全軌跡監控與 7 個逐步監控的評測結果。
-
LMNet:清華、北京團隊讓語言模型以向量互通,文字介面可能只是一個過渡
清華大學與北京研究院於 2026 年 6 月 13 日發表 LMNet(Language Model Networks),架構核心是將多個精簡版 LLM 設為節點、以可訓練的 seq2seq 映射作為邊,讓模型間傳遞稠密向量而非文字。
-
模型主權:Fable/Mythos 停供的供應鏈課
2026 年 6 月 13 日,Anthropic 在 Fable 5 與 Mythos 5 上線僅三天後宣布,依美國政府指令暫停外籍使用者對這兩款模型的存取,合規處理期間全球客戶一併受到波及,存取全數中斷。Anthropic 對評估報告提出異議,稱政府只提供了口頭證據,涉及的是「狹窄、非普遍性的越獄」,且類似能力在
-
沒被授權,它造了一套截圖工具鏈:從 Fable 實測看高自主 Agent 的邊界
2026 年 6 月 11 日,Datasette 與 LLM 開源工具作者 Simon Willison 僅授權 Claude Fable「查依賴找橫向捲軸 bug」,離開電腦幾分鐘後回來,發現 Fable 已自行安裝 `pyobjc-framework-Quartz`、枚舉系統視窗,並在 Safari 截圖驗證。
-
月之暗面開源 Kimi-K2.7-Code,多項編程基準超越前代、推理 token 用量降三成
月之暗面於 2026 年 6 月 12 日正式發布並開源 Kimi-K2.7-Code,同日透過 Kimi API 與 Kimi Code 對外開放,工程師今日即可取用。與上代 K2.6 相比,新模型在三項主要編程基準都有明顯進步,推理階段的 token 用量也同步降低三成。能力與效率雙向改善,這次更新比單純的基準刷新
-
別再寫 Prompt:設計驅動 Agent 的 Loop
6 月 10-11 日,Steipete、Boris、Andrej 在各自平台說了幾乎相同的話:停止手動 prompt agent,去設計驅動 agent 的 loop。三個獨立聲音在同一周收斂,不是趨勢預言,是工作型態轉型的信號點。但他們說的到底代表什麼改變?
-
答題學霸不等於干活能手:Agents' Last Exam 讓 Fable 5 輸給 GPT-5.5
2026 年 6 月 12 日,UC Berkeley 發布 ALE(Agents' Last Exam)基準,要求 AI agent 在 Siemens NX、Unreal Engine、Adobe After Effects 等真實軟體裡複製人類領域專家已完成的任務;冠軍 GPT-5.5 + Codex 通過率 2
-
OpenAI 收購 agent 雲端執行平台 Ona,Codex 長任務基建補齊、Managed Agents 呼之欲出
6 月 11 日,OpenAI 宣布收購 Ona,一個專為 AI agent 設計的雲端執行平台。官方說明指向兩個具體目標:讓 Codex 能在使用者關閉筆電後仍持續跑長時間任務,以及協助更多企業在生產環境安全部署 agent。相比於模型能力的持續迭代,這筆收購讓 OpenAI 開始明確補上 agent 執行層的基礎設
-
多模態瓶頸不在參數量:Gemma 4 12B 的 encoder-free 路線訊號
過去兩年,多模態模型的標準做法是:用獨立的視覺與音訊 encoder 先把圖像或聲音轉成 embedding,再餵給語言模型主幹。這套架構能力有了,但代價清楚:兩套模型同時佔記憶體,延遲疊加,端側部署的門檻壓不下來。
-
從「過單測」到「能 merge」:coding 評測的方法論轉向
FrontierCode 告訴你,那些通過的 PR,多數不會被真正的 maintainer merge 進 main。
-
當 Agent 取代人下單:蚂蚁 AMP 押注的支付基礎設施戰場
過去五年,移動支付解決的是「人的支付便利」;接下來五年,問題可能變成「如何讓一個 AI 智能體替你買機票、續訂閱、甚至購買 Token,而商家願意接單」。蚂蚁國際在今年五月推出的移動智能體協議(Agentic Mobile Protocol,AMP)正是針對這個錯位而設計:現行全球支付標準幾乎全部預設交易主體是持卡人,
-
OpenEnv:開源 AI Agent 訓練缺的那層基建
當前 AI agent 訓練的競爭,正從單純的模型能力比拼,移向 harness 與模型的協同優化。Claude Code、Codex、OpenClaw、Hermes 這類 agent harness 持續進步,背後的關鍵之一是:前沿實驗室的模型與自家 harness 一起訓練,GPT-5.5 和 Opus 4.8 都