Anthropic 發表 Claude Opus 5!效能直逼 Fable 5 價格卻只要一半
2026 年 7 月 24 日,Anthropic 正式推出 Claude Opus 5,API 定價維持每百萬權杖輸入 5 美元、輸出 25 美元,僅為旗艦 Fable 5 的一半,但在 CursorBench 3.2 等基準測試中與後者峰值差距縮至 0.5%。

重點摘要
- 2026 年 7 月 24 日,Anthropic 正式推出 Claude Opus 5,API 定價維持每百萬權杖輸入 5 美元、輸出 25 美元,僅為旗艦 Fable 5 的一半,但在 CursorBench 3.2 等基準測試中與後者峰值差距縮至 0.5%。
- Opus 5 在 Frontier-Bench 軟體工程表現達上一代 Opus 4.8 的兩倍以上,且在 OSWorld 2.0 電腦操作測試中以略高於 Fable 5 三分之一的成本超過其最佳成績,顯示計算效率顯著提升。
- 安全策略上,Opus 5 的安全護欄觸發頻率預計比 Fable 5 減少 85%,雖未針對網路安全任務訓練,其漏洞發現能力已接近 Mythos 5,但漏洞利用能力仍明顯落後,Anthropic 保留二進位漏洞掃描等硬性限制。
2026 年 7 月 24 日,Anthropic 正式發布 Claude Opus 5,將 API 定價設定為每百萬權杖輸入 5 美元、輸出 25 美元,與上一代 Opus 4.8 完全相同,卻只有當前旗艦 Fable 5(輸入 10 美元、輸出 50 美元)的一半。這不只是調整價格,而是 Anthropic 明確轉變了模型定位。根據 Datasette 與 LLM 開源工具作者 Simon Willison 的報導,Anthropic 將 Opus 5 當作是一款深思熟慮且主動的模型,其智慧水準接近 Fable 5 的邊界表現,但成本僅為後者的一半。Anthropic 同時宣佈,Opus 5 將成為 Claude Max 的預設模型,也是 Claude Pro 上最強的可用模型,目標場景涵蓋企業辦公、軟體開發、科學研究與 AI 代理工作流。
Anthropic 推出 Claude Opus 5,以旗艦模型半價的定位與極致的計算效率,重新定義了企業級 AI 的價效比戰場。
基準測試差距縮小,接下來大家要拼效率
在最影響企業買單的軟體工程場景中,Opus 5 與 Fable 5 的差距已經小到無法忽視。Anthropic 表示,Opus 5 在 CursorBench 3.2 最高努力等級下的成績,距 Fable 5 峰值只差 0.5%,完成同一項任務的成本卻只有 Fable 5 的一半。在 Frontier-Bench 軟體工程測試中,Opus 5 超過其他所有參測模型,表現達 Opus 4.8 的兩倍以上。Simon Willison 指出,Opus 5 目前領先 Artificial Analysis 智慧排行榜,排名甚至在 Fable 5 之前。
自動化與電腦操作的數字更直接。在 OSWorld 2.0 電腦操作基準測試中,Opus 5 以略高於 Fable 5 三分之一的成本,超過後者的最佳成績。在 ARC-AGI 3 測試中,Opus 5 的得分約為排名第二模型的 3 倍。Zapier 執行長 Wade Foster 報告,Opus 5 在 AutomationBench 任務中達成 100% 通過率。按相同任務成本比較,其通過率約達第二名的 1.5 倍。Anthropic 在這裡強調的不再只是原始分數,而是相同預算能完成多少任務,連評估模型的標準都跟著變了。
科學研究是 Anthropic 另外拉出來的一條線。在有機化學任務上,Opus 5 比 Opus 4.8 高 10.2 個百分點;預測蛋白質序列變化影響則進步 7.7 個百分點。把這類高度專業的基準測試納入發布重點,看起來是在試圖拉開與純文字生成模型的距離。Simon Willison 分享了一個具體案例:在 Frontier-Bench 任務中,Opus 5 面對一份無法直接檢視的機械零件圖,自主編寫電腦視覺管線從原始畫素中提取幾何資料,並重建為 3D FreeCAD 模型。
為什麼要在旗艦之外另立梯次?
Opus 5 背後有幾條壓力同時在收緊。中國 AI 廠商持續用低價和開放權重模型打價格戰,企業挑選供應商時,不再只看「誰最強」,更看重「誰最划算」。已有企業因 AI 支出快速成長而收緊使用限制,重新評估投入產出比。Anthropic 研究產品管理負責人 Dianne Penn 也直接回應了這個趨勢。
Anthropic 給企業的邏輯大致是:旗艦模型存在,但不必每個任務都動用旗艦。Opus 5 的位置,是讓多數日常工作不需要以 Fable 5 的定價跑完,同時不用妥協到開源替代方案的能力下限。這代表對跑大量自動化代理的工程師來說,選模型時多了一個現實問題:這項任務 Opus 5 應付得來嗎?如果夠,帳單大約減半。
Anthropic 這次也特別強調「計算效率」,也就是完成相同任務所需的推理權杖數量。Opus 5 在部分測試中達到接近表現所消耗的權杖明顯更少。就算每百萬權杖費率相同,模型思考路徑越短,實際成本就越低,這個差距在規模化部署時會被放大。對工程師而言,光看每百萬權杖報價已經不夠,任務完成的權杖消耗也要一起算進去。此外,Opus 5 提供快速模式,速度約為標準模型的 2.5 倍,定價為基礎費率的兩倍,進一步細化效能與成本的選擇。
安全分類器放寬,邊界在哪裡?
Opus 5 的網路安全能力,是這次發布另一條值得留意的線。Anthropic 表示,Opus 5 在發現軟體漏洞方面的能力已接近更高階的 Mythos 5,但把漏洞轉化為實際攻擊工具這一步仍明顯落後。關鍵細節是,Anthropic 強調這個進步「主要來自通用能力提升」,並非針對網路安全任務另行訓練。換句話說,模型越強,附帶的安全相關能力自然跟著提升,這個趨勢不因廠商的主觀選擇而消失。Simon Willison 指出,Anthropic 刻意避免在網路利用任務上訓練 Opus 5,延續了 Opus 4.8 的政策,但 Opus 5 在尋找網路安全漏洞方面已有實質改進。
安全分類器的調整也很有看頭。Opus 5 的限制相比 Fable 5 明顯更寬鬆,幹預次數將大幅減少,預計比 Fable 5 少 85%。Anthropic 保留了幾條硬性限制,包括二進位漏洞掃描、滲透測試和漏洞利用程式碼生成,但整體門檻下移。Anthropic 這樣調整,是為了讓模型真正進入企業的網路安全、研究和工程場景,不再卡在過度保守的過濾層前面。對建構安全應用的團隊而言,這意味著更多邊界判斷從 Anthropic 那一層轉移到你自己的應用層,你的應用邏輯需要做更多事。
回顧 2026 年 6 月 10 日,Anthropic 同時推出 Fable 5 與 Mythos 5,前者強化安全護欄,後者明確不帶安全分類器。Fable 5 配套了新 API 機制,護欄觸發拒答時系統主動通知呼叫方,支援備用路由設定。然而,上市僅兩天,Anthropic 就對 Fable 5 的某項政策走回頭路。Opus 5 的發布,似乎是在這兩極之間尋找更務實的平衡點。
業界反應與後續影響
Devin 執行長 Scott Wu 表示,Opus 5 以半價接近 Fable 級別的表現。Cursor 共同創辦人 Sualeh Asif 形容 Opus 5 提供接近 Fable 5 的智慧,卻具備 Opus 的速度與成本。這些來自下游應用創始人的評價,顯示 Opus 5 的定位已獲得市場初步認可。Anthropic 也隨模型發布了專用的提示詞指南,協助開發者更有效使用。
然而,Mythos 5 在網路安全利用與自主生物研究任務上仍保持優勢。Anthropic 明確指出,對於需要極致能力或特定高風險場景,Mythos 5 仍是首選。這意味著 Anthropic 的模型矩陣並非簡單取代,而是分層服務不同需求。
Anthropic、OpenAI、Meta 據報都在加快推出更具成本效率的模型,中國廠商的開放權重方案更直接把門檻拉低。當 Opus 5 能以半價在多數任務上貼近旗艦,企業的採購決策就很難只看基準測試榜單的第一名。這輪競爭最後比的,看起來是每一美元能幫企業做多少事。下一個問題不是「誰訓練出最強模型」,而是「誰能讓足夠強的模型,以半價大規模跑完你的工作流」。對工程師和創業者來說,現在值得重新校準的,是選模型時你優先看哪個指標。Opus 5 的出現,迫使開發者在智慧極限與成本效率之間做出更精確的權衡,這可能成為未來 AI 基礎設施採購的新常態。


