出品 | 網(wǎng)易智能
作者 | 辰辰
編輯 | 王鳳枝
Opus 5在編程、知識工作和計算機操作等多項測試中贏了Fable 5。
然后Anthropic說:這不是我們最好的模型。
北京時間7月25日凌晨,Anthropic發(fā)布了Claude Opus 5。定價和上一代Opus 4.8持平:每百萬輸入token 5美元,輸出25美元,是Fable 5的一半。
![]()
性能呢?
Frontier-Bench編程評測中,Opus 5得分43.3%,高于Fable 5的33.7%;與Opus 4.8的18.7%相比,則翻了一倍多,單次任務成本還更低。GDPval-AA知識工作評測,Opus 5拿1861分,F(xiàn)able 5是1747分,GPT-5.6是1736分。OSWorld 2.0計算機使用測試、AutomationBench商業(yè)流程測試、Humanity's Last Exam帶工具,Opus 5全部超過Fable 5。在ARC-AGI 3上,它的得分是第二名模型的三倍。
![]()
但無論是Anthropic的官方博客,還是產(chǎn)品管理負責人黛安·佩恩(Dianne Penn)接受CNBC采訪時,措辭都極為精確:Opus 5只是“接近”Fable 5的能力,F(xiàn)able 5仍然是“你最雄心勃勃的工作”該用的模型。一個在大多數(shù)考場里分數(shù)更高的學生,被官方定性為“接近”那個分數(shù)更低的學生。
這不是話術(shù)失當。這是產(chǎn)品線的重新排位。
一、不是排行榜,是分工表
要理解這件事,先看Anthropic這兩個月鋪出來的模型矩陣。它不是從強到弱排下來的,是按場景分的。
Mythos 5是網(wǎng)絡(luò)安全和高風險科研方向的專用模型,能力最鋒利,開放范圍也最窄。曾觸發(fā)美國政府以“國家安全”為由的出口管制,被短暫下線兩周。
Fable 5面向最復雜、持續(xù)數(shù)天的自主任務。6月發(fā)布時被Amazon研究人員發(fā)現(xiàn)可繞過安全護欄,Anthropic于6月12日將其下架,6月30日重新上線。它是Anthropic保留給“最雄心勃勃工作”的旗艦,也是最貴的。
Opus 5面向日常編程、知識工作和企業(yè)智能體,價格更低,適合高頻使用。從Opus 4到4.8,它一直是很多開發(fā)者心中“寫代碼最靠譜的模型”。但這一定位讓它剛好卡進了模型矩陣里最擁擠的一段。
Sonnet 5在7月1日發(fā)布時定位“日常最高效”。Opus 5一出,“日常”這個位置上突然出現(xiàn)了兩個選手。
ZDNET的評論一針見血:“Sonnet 5被卡在一個尷尬的位置:夾在更便宜但弱得多的Haiku 4.5,和更強但更貴的Opus與Fable之間。”
而Opus 5發(fā)布后,Sonnet卡在Haiku和Opus之間,Opus卡在Sonnet和Fable之間,F(xiàn)able卡在Opus和Mythos之間。
一位X用戶說得很準:“Opus 5像是GPT-5.6和Fable 5之間的一個奇怪但有用的中間態(tài)。它有Fable的品味,又有GPT-5.6的徹底和較真。代碼不如Fable寫的漂亮,但更可能是對的。”
![]()
二、一邊拉胯,一邊封神
第一天的口碑出現(xiàn)了罕見的撕裂。但仔細看,罵的人和夸的人說的其實是同一件事:Opus 5不是Opus 4.8的升級版,它是一個需要重新適應和學習的新模型。
Every聯(lián)合創(chuàng)始人丹·希珀(Dan Shipper)的團隊花了一周反復測試,結(jié)論毫不留情:“一個很難讓人愛上的模型。”
![]()
其中一句原話更狠:“窮人的Fable。它有Fable的很多性格怪癖,但沒有Fable的天才。”
希珀團隊發(fā)現(xiàn)了兩個反直覺的現(xiàn)象,這兩個現(xiàn)象指向同一個根源:Opus 5的行為模式和舊模型完全不同,不能當平替用。第一,向后兼容性很差:把它塞進給舊模型寫的skills和工作流里,它會提前停下、漏掉指令,甚至不配合。“刪掉舊工作流從零開始,效果立刻好很多。”第二,思考強度設(shè)得越低,表現(xiàn)反而越穩(wěn)定。“你給它越多時間思考,它越容易出煩人的行為。”希珀的結(jié)論是:天才任務用Fable,日常用GPT-5.6,Opus 5只在Fable額度跑完時頂上。
一位西班牙用戶在X上給Opus 5打了5分,滿分10分,F(xiàn)able 5他給8分。評語是“小模型的味道,emoji太多”,“看起來不像同一個模型家族的。”
![]()
名為VooStack的用戶將這種現(xiàn)象稱為“模型漂移債務”:“每發(fā)一個新模型就意味著重構(gòu)提示詞。真正的路線圖殺手。”
![]()
但另一邊,贊美同樣猛烈。
Cursor聯(lián)合創(chuàng)始人蘇阿萊·阿西夫(Sualeh Asif)說:“Opus 5以O(shè)pus的速度和成本,達到接近Fable 5的智能。在CursorBench上只差不到0.5%。”
法律AI公司Harvey的應用研究主管尼科·格魯彭(Niko Grupen)給了更具體的數(shù)字:Opus 5在保持質(zhì)量的同時,平均比Opus 4.8少生成26%的token。在公司治理和仲裁業(yè)務線上,增幅最明顯。
還有更夸張的。一位用戶在X上發(fā)視頻:完全不會寫代碼,靠Opus 5在15分鐘內(nèi)做出了三個可運行的本地網(wǎng)站原型。
![]()
另一個用戶說Opus 5做了一個他“見過最好的火箭聯(lián)盟克隆游戲”,“車的反射、細節(jié),簡直離譜”。
大家說的是同一款模型。分歧點不在于模型好不好,而在于你把它當什么用:當成Opus 4.8的即插即用替代品,會翻車;當成一個需要重新學習使用方法的新工具,可能超出預期。
三、更偏防守
公平地說,Opus 5在少數(shù)評測上確實不如Fable 5。內(nèi)部法律智能體評測中Fable領(lǐng)先,DeepSWE編程測試上Fable略高。在網(wǎng)絡(luò)安全漏洞利用(把漏洞變成實質(zhì)性威脅)的能力上,它被刻意留在Mythos 5之后。有機化學和蛋白質(zhì)設(shè)計上,則是Opus系列最強。
![]()
這種差距來自訓練階段的選擇,而非護欄的松緊。
Anthropic在安全白皮書里坦白:Opus 5沒有接受過網(wǎng)絡(luò)安全任務的專門訓練,“因為通用能力變強了,這個能力也跟著水漲船高。”因為模型本身的攻擊能力天花板就低,安全護欄可以比Fable 5放得更寬,分類器攔截頻率少了約85%。
但這不意味著不設(shè)防:二進制漏洞掃描、滲透測試和漏洞利用生成等高風險請求仍然會被攔截。源代碼級別的漏洞查找,放行。
設(shè)計思路很清楚:更偏防守,不向普通用戶放開進攻能力。
四、拆開“最好”
安全護欄的收窄是一筆賬。定價和定位的收窄,是另一筆賬。
CNBC的報道點破了一個關(guān)鍵事實:“企業(yè)客戶越來越關(guān)注成本,如果沒有清晰的投資回報率畫面,就不愿意為昂貴模型買單。”
佩恩點到了問題的關(guān)鍵:“企業(yè)客戶在尋找價值。如果一個模型更便宜,但達不到類似質(zhì)量,它其實沒有用。”
翻譯一下:我們不打價格戰(zhàn)。我們打價值戰(zhàn)。
但Opus 5做的事,比“價值戰(zhàn)”更聰明。性能大幅提升,價格原地不動。對企業(yè)而言,用同樣的預算可以買到更多智能和更長的工作時間。另外,Opus 5的一般訪問不附帶數(shù)據(jù)留存要求:企業(yè)不必為了獲得接近Fable的能力,同時接受更高價格和更敏感的數(shù)據(jù)條件。
曾在ZDNET評測中自稱“重度Opus 4.8用戶”的大衛(wèi)·格維爾茨(David Gewirtz)說了一個細節(jié):他用100美元的Claude Max訂閱跑了整整一周的大規(guī)模智能體任務,用量只到31%。“換Opus 5之后,估計能做更多事。”
OpenAI同月發(fā)布的GPT-5.6 Sol,定價比Opus 5略貴,每百萬輸出token 30美元。在Anthropic自己公布的對比表中,Sol只在DeepSWE一項編程測試上贏了Opus 5,其他全部落后。谷歌的Gemini模型則根本沒出現(xiàn)在表里。
按AI行業(yè)媒體The New Stack的說法:“顯然,Anthropic覺得它們不配多占一列。”
節(jié)奏很清楚了:Anthropic不打算靠價格屠殺對手,它要做的事更精細。
Mythos是最好的武器。只給經(jīng)過審查的企業(yè)和研究者用。
Fable是最好的大腦。留給“最雄心勃勃的工作”,留給那些“以前什么都做不了的、持續(xù)數(shù)天的自主項目”。
Opus是最好的工具。每天早上第一個打開,什么都能干,不用心疼token。
Opus 5卡在“夠好”和“最好”之間。這個位置不是意外,是Anthropic算過的。
