重點摘要:
- Opus 5 每百萬輸入代幣收費 5 美元,僅為 Fable 5 的一半價格
- 在 Frontier-Bench 上獲得 43.3% 分數,是 Opus 4.8 的 18.7% 兩倍以上
- Anthropic 將其定位為企業 AI 工作負載的日常驅動主力
重點摘要:

Anthropic 於 7 月 24 日發布 Claude Opus 5,將其定位為一款成本僅為頂級 Fable 5 一半的接近前沿模型——這是一次押注企業 AI 支出將從追求原始能力轉向效率的賭注。
這款新模型定價為每百萬輸入代幣 5 美元、每百萬輸出代幣 25 美元——與前一代 Opus 4.8 相同——並成為 Anthropic Max 訂閱方案的預設模型,同時也是 Pro 方案中最強大的選項。Anthropic 並未聲稱 Opus 5 是其最聰明的模型;這項殊榮仍屬於價格約為其兩倍的 Fable 5。相反地,Anthropic 提出了一個更微妙的論點:最具經濟價值的 AI 工作發生在中間難度區間,在這個區間內,高效提供的接近前沿智慧比昂貴的前沿智慧更具優勢。
「Opus 5 是你的日常驅動主力,是你交付複雜工作並在完成後審閱的模型,」Anthropic 發言人告訴 VentureBeat。「Fable 5 則是為你最雄心勃勃的工作——那些耗時數天、以前無人能承擔的自動化專案——而準備的。」
在基準測試中,Opus 5 在編碼和知識工作評估(包括 Frontier-Bench 和 GDPval-AA)上創下新高。它在 Frontier-Bench v0.1(一項代理終端編碼基準)上獲得 43.3% 的分數——是 Opus 4.8 的 18.7% 的兩倍以上,並領先 Fable 5 的 33.7%,且每項任務成本更低。在 ARC-AGI 3(一項新穎問題解決測試)中,Anthropic 表示 Opus 5 的分數是次佳模型的三倍。在 OSWorld 2.0(一項電腦使用基準)中,它以略高於 Fable 5 三分之一的成本擊敗了 Fable 5 的最佳成績。在 CursorBench 上,它在最大努力下與 Fable 5 的峰值差距在 0.5 個百分點以內,而每項任務成本僅為一半。
該公司承認,在網路安全任務和生物學研究方面,Opus 5 仍落後於競爭對手 Mythos 5。在一項內部生物學練習中,該模型反覆陷入自我驗證循環,未能交付 Mythos 5 所完成的蛋白質設計。Anthropic 也指出,Opus 5「儘管整體準確度更高,但其事實性陳述的幻覺程度略高於 Opus 4.8。」
早期採用者描述了超越基準分數的效率提升。法律 AI 公司 Harvey 表示,Opus 5 實現了與 Opus 4.8 最大推理模式相似的效能,「同時平均減少了 26% 的代幣生成量」,Harvey 應用研究主管 Niko Grupen 表示。Fundamental Research Lab 的 Richard Pham 表示,在困難的財務建模任務中,該模型平均準確率高出九個百分點,「同時使用的回合數和工具呼叫量約減少三分之一,時間減少 60%。」
Zapier 執行長 Wade Foster 表示,Opus 5 在其公司的 AutomationBench 排行榜上名列第一,「且沒有花費比先前 Claude 模型更多的代幣」,從頭到尾完整運行了客戶流失預防工作流程。「先前的模型未能通過;Opus 5 達到了 100%,」他表示。Devin 編碼代理公司 Cognition 的執行長 Scott Wu 表示,在 FrontierCode 1.1 上,「Claude Opus 5 以一半成本達到了接近 Fable 級別的效能」,特別在除錯和根本原因分析方面表現出色。
該模型配備了可調節的運算強度設定,讓客戶可以在推理深度與較低的代幣成本和更快的回應速度之間進行取捨,此外還提供快速模式,運行速度約為預設速度的 2.5 倍,價格為基礎價格的兩倍。Anthropic 還新增了 API 上的自動回退路由,以及對話中途的工具變更功能,這不再使提示快取失效——這是代理開發者長期以來要求的功能。
Anthropic 表示,Opus 5 是其迄今為止最符合對齊要求的模型,在其內部不合規行為審計中得分為 2.3——低於 Opus 4.8、Sonnet 5 或 Fable 5——同時具有最低的欺騙行為率和被誘導誤用的風險。該公司刻意避免對 Opus 5 進行網路任務訓練(如同對 Opus 4.8 所做的那樣),儘管該模型作為通用能力提升的附帶效應,仍然在這些任務上有所改進。在 Anthropic 的 OSS-Fuzz 評估中,Opus 5 以 79.4% 的比率識別漏洞,接近 Mythos 5 的 80%,但在開發漏洞利用方面僅成功完成了四項挑戰,而 Mythos 5 完成了 13 項——這種不對稱似乎是刻意的。
當安全分類器觸發時,請求會預設回退到 Opus 4.8。「回退模型的效能水平較低,從而也降低了有害使用的風險,」發言人表示。與 Fable 和 Mythos 不同,Opus 5 在通用存取方面沒有數據保留要求——該公司特別向「有嚴格零數據保留要求」的客戶強調了這一點。
此次發布正值 Anthropic 商業動能空前強勁之際。根據路透社報導,該公司在最新一輪融資中的估值約為 3800 億美元,此前其年化營收從 2024 年底的約 10 億美元攀升至 2025 年底預計的 90 億美元,內部目標更指向 2026 年達到 200 億至 260 億美元。這些目標背後是巨額的基礎設施承諾,包括據報導與微軟 Azure 達成的 300 億美元計算協議,以及與 Google Cloud 和 Nvidia 的安排。
對投資人而言,其影響橫跨整個 AI 價值鏈。Anthropic 的定價策略——在關鍵代理基準上效能約提升一倍的情況下,將 Opus 5 維持在 Opus 4.8 的價格水平——實際上是在每單位能力上進行大幅降價,旨在擴大可經濟自動化的工作負載範圍。每一個在 Opus 4.8 的成本效益比上處於邊際的任務,在 Opus 5 上都變得可行,而每一個可行的任務都是經常性代幣收入。對於 Nvidia、微軟和 Google 而言,問題在於這種效率提升是否能夠擴大總體可及市場,足以抵銷每次推理收入的下降——或者這是否預示著一個模型商品化壓縮基礎設施供應商利潤的市場。Anthropic 的賭注是:更便宜的智慧會創造更多需求,而非更少。
本文僅供資訊參考,不構成投資建議。