剛剛,Anthropic 正式發(fā)布新一代模型 Claude Opus 5。
![]()
此時距離該公司與美國政府的最新一輪交鋒剛過去數(shù)周,距離 OpenAI 引發(fā)全行業(yè)熱議的安全事件也僅數(shù)日。
時機頗為微妙。
官方博客稱,Claude Opus 5 是一款更具主動性、也更審慎的模型,其智能水平接近 Claude Fable 5,而價格卻只有后者的一半。
在 Frontier-Bench、GDPval-AA 等編程與知識工作評測中,它刷新了行業(yè)最高紀錄,僅在網(wǎng)絡安全任務上落后于 Mythos 5。
它的運行效率高于其他模型,適合高頻日常使用。目前它已成為 Claude Max 的默認模型,同時也是 Claude Pro 上最強的選擇。
![]()
性能表現(xiàn)
與前代 Opus 4.8 相比,Opus 5 在成本不變的前提下大幅提升了性能。用戶可通過「努力程度」(effort)設置自由權(quán)衡性能:調(diào)高可獲得更強的智能,調(diào)低則更快、更省 token。
編程方面,在 Frontier-Bench v0.1 中,Opus 5 超越所有對手,得分達到 Opus 4.8 的兩倍以上,單任務成本反而更低。
![]()
在 CursorBench 3.2 中,它在最高努力檔位下與 Fable 5 的峰值成績僅差 0.5%,成本只有一半;在 high、xhigh 和 max 三個檔位上,同等成本下的表現(xiàn)均領(lǐng)先所有其他模型。
![]()
![]()
知識工作與問題解決方面,成績同樣亮眼。
ARC-AGI 3 考察模型解決全新問題的能力,Opus 5 的得分是第二名的三倍。
![]()
Zapier AutomationBench 衡量端到端完成商業(yè)任務的水平,它在相同單任務成本下的通過率約為次優(yōu)模型的 1.5 倍;即便調(diào)到最低努力檔位,通過的任務數(shù)也多于任何競爭者。
![]()
OSWorld 2.0 是一項計算機操作基準,Opus 5 在任意成本點上都勝過其他模型,并以約三分之一的成本超過了 Fable 5 的最佳成績。
![]()
在多項相關(guān)評測中,它同樣是最強且最具性價比的模型。
![]()
![]()
![]()
科研能力顯著進步
Opus 5 在生命科學的每一項評測中都優(yōu)于 Opus 4.8,覆蓋結(jié)構(gòu)生物學、有機化學和生物信息學等方向。
進步最明顯的是有機化學:在根據(jù)波譜數(shù)據(jù)推斷分子結(jié)構(gòu)的內(nèi)部基準上,它比前代高出 10.2 個百分點。在預測序列變異如何影響蛋白功能的評測中提升了 7.7 個百分點。
此外,它生成的可視化產(chǎn)出質(zhì)量也大幅增強。比如,Opus 5 將空氣流過空氣動力學(和非空氣動力學)物體的流動情況可視化,或者制作一個簡化版的交互式細胞示意圖。
更強的自主性與嚴謹性
Opus 5 更擅長核查自己的工作,并持續(xù)迭代直到成功。
在 Frontier-Bench 的一項任務中,模型需要根據(jù)一張機械零件圖紙編寫代碼,用 FreeCAD 重建三維模型,卻被刻意剝奪了直接查看圖紙的途徑。Opus 5 自行編寫了計算機視覺流水線,從原始像素中提取幾何信息,最終完整重建了零件,并能穩(wěn)定復現(xiàn)這一結(jié)果。相同條件下,競品模型嘗試五次均告失敗。
針對一款流行的開源軟件包管理器中存在的真實漏洞,Opus 5 找到了根本原因,并修復了社區(qū)補丁遺漏的一個極端情況。而競爭對手的版本僅僅修復了表面癥狀(并未觸及根本原因),然后就報告漏洞已解決。
一家交易公司的工程師使用 Opus 5 在一次會話中就為一家新交易所構(gòu)建了市場數(shù)據(jù)源。之前的模型根本無法完成這項任務,即使工程師提供了詳盡的計劃。由于沒有可供驗證的實時數(shù)據(jù)源,Opus 5 甚至自行構(gòu)建了測試框架,以檢查其代碼是否正確解析了交易所的數(shù)據(jù)。
對齊與安全:迄今最可靠的版本
Anthropic 稱,部署前的自動化行為審計顯示,Opus 5 是 Anthropic 迄今對齊程度最高的模型。它對 Claude 憲章的遵循度超過 Opus 4.8、Sonnet 5 和 Fable 5,欺騙行為發(fā)生率最低,也最難被誘導濫用。在避免可能造成難以逆轉(zhuǎn)后果的魯莽操作方面,它同樣創(chuàng)下最佳紀錄。
![]()
在自動化行為審計中,Opus 5 在整體不協(xié)調(diào)行為方面得分為 2.3,是 Anthropic 最近推出的模型中得分最低的。
在高風險的兩用能力上,Opus 5 沒有突破現(xiàn)有邊界。
Anthropic 與私營部門及政府伙伴合作開展的嚴格評估表明,它在生物研究和進攻性網(wǎng)絡安全兩個方向都落后于 Mythos 5。
團隊延續(xù)了對 Opus 4.8 的做法,刻意不針對網(wǎng)絡任務訓練該模型。隨著通用能力增強,模型在這類任務上仍有可觀進步,發(fā)現(xiàn)安全漏洞的水平已接近 Mythos 5,但把漏洞轉(zhuǎn)化為實際網(wǎng)絡威脅的能力差距依然很大。
OSS-Fuzz 評測印證了這一點:兩個模型識別漏洞的成功率相近,可在開發(fā)利用程序的環(huán)節(jié),Opus 5 的得分遠遠落后。
![]()
在 Anthropic 的網(wǎng)絡安全評估之一 OSS-Fuzz 中,Opus 5 在識別軟件漏洞方面與 Mythos 5 非常接近(左圖),但在開發(fā)針對這些漏洞的攻擊方面則遠不如 Mythos 5 成功(右圖)。
分級防護:兼顧安全與可用
Opus 5 的防護體系與 Opus 4.8 大體一致,僅在少數(shù)網(wǎng)絡任務上加強了限制。
其網(wǎng)絡安全分類器比 Fable 5 寬松,允許在源代碼中查找漏洞,但會攔截二進制層面的漏洞掃描、滲透測試和利用程序生成,因為這些方法更常與惡意行為者相關(guān)。
據(jù)測試,分類器的干預頻率預計比 Fable 5 低約 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,被攔截的請求默認回退至 Opus 4.8 處理,API 用戶也可開啟同樣的回退機制。已加入網(wǎng)絡驗證計劃(CVP)的企業(yè)和研究者可立即使用限制更少的版本。
生物方向的防護延續(xù)前代設計,這讓 Opus 5 成為目前公開可用模型中科研能力最強的一款。不過它在長時程自主研究任務上仍有明顯局限,而這恰是生物風險最集中的場景,Mythos 5 在此類工作上依然更強。本次發(fā)布后,在 Fable 5 上被攔截的生物類請求將改為路由至 Opus 5。
定價與新功能
Opus 5 即日起在所有平臺上線,定價為每百萬輸入 token 5 美元、輸出 25 美元,與前代持平,且只有 Fable 5 的一半,也略低于 OpenAI 的 GPT-5.6
新推出的「極速模式」(Fast mode)以兩倍價格提供約 2.5 倍的默認速度,目前處于研究預覽階段。用戶還可選擇開啟自動回退:當安全分類器攔截 Opus 5 或 Fable 5 的請求時,系統(tǒng)會自動路由到其他可用模型,確保請求始終得到最佳模型的響應。
此外還有兩項測試版更新:Claude 平臺支持在對話中途更換工具而不使提示緩存失效;API 端支持上述自動回退功能。與此前的 Opus 系列一致,Opus 5 的通用訪問不設數(shù)據(jù)保留要求。
https://www.anthropic.com/news/claude-opus-5
https://www.theverge.com/ai-artificial-intelligence/970105/claude-opus-5-announced-anthropic-ai-model-release
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.