![]()
用中端模型的成本優勢,補上旗艦模型的缺。
作者|樺林舞王
編輯|靖宇
六月的最后一天,Anthropic 在官網上線了兩條公告。
一條是 Claude Sonnet 5,Anthropic 自己給它的定位是「最具代理能力的 Sonnet 模型」。另一條是 Claude Science,一個面向科研人員的 AI 工作臺。兩件事放在同一天發布,單看任何一條都像是常規迭代,但把它們放進過去三周的背景里,畫面就不一樣了。
01
Agent 能力加強,Sonnet 5 直追 Opus
先說 Sonnet 5 的數字。
在 SWE-bench Verified 這個衡量代碼能力的基準測試上,Sonnet 5 的得分是 92.4%。Anthropic 自家的 Opus 4.6 是 80.8%,OpenAI 的 GPT-5.4 是 57.7%。這是 Anthropic 的中間檔模型,用 Sonnet 的定價,跑出了超過旗艦的數字。
![]()
Sonnet 5 模型相對旗艦模型的能力也不遑多讓|圖片來源:Anthropic
定價層面,上線初期每百萬輸入 token 收 2 美元,輸出 10 美元,8 月 31 日之后升到 3 美元和 15 美元。對照 Opus 4.8,便宜一大截,也比 GPT-5.5 和 Gemini 3.1 Pro 更低。
Anthropic 在發布文檔里說,Sonnet 5 能制定計劃、使用瀏覽器和終端工具,以「自主方式」運行——而「這在幾個月前需要更大、更昂貴的模型才能實現」。這句話說得直白,等于是在公開承認:旗艦模型的能力正在向下滲透,速度比外界預期的快。
![]()
在不同模型不同檔位下代理工作完成水平 Sonnet 5 和 Opus4.8 非常接近了|圖片來源:Anthropic
Zapier 的工程師 Daniel Shepard 測試了一個兩步驟任務,讓模型同時更新 Salesforce 賬戶等級并向企業聯系人發送公告。他的反饋是,Sonnet 5「從頭到尾完成了整個任務,這在過去會中途停頓」。這類具體的工程反饋比基準分數更有參考價值——它說明代理任務的可靠性門檻正在被突破,而且是在中端定價上突破的。
對于構建多步驟自動化流程的團隊來說,這改變了一道關鍵的成本計算題:以前必須調用旗艦模型才能完成的任務,現在可以用三分之一甚至更低的價格搞定。
02
政府的那封信,和被壓住的旗艦
把時間撥回兩周前,這次發布的背景會清晰很多。
6 月 12 日,Anthropic 暫停了 Fable 5 和 Mythos 5 兩個新模型的訪問權限,原因是美國政府的出口管制指令——禁止非美國國民使用這兩個模型。外界猜測觸發點之一是政府發現了 Fable 5 的某個越獄方法,能繞過其最強能力的安全防護。
兩周之后,6 月 26 日,美國商務部長發出一封信,批準 Anthropic 向約 100 家公司和聯邦機構有限發布 Mythos 5,表述是「已確定存在適當的保障措施」。但 Fable 5 的訪問權限至今未獲批準恢復。
所以,6 月 30 日這一天,Anthropic 的真實處境是:最強的兩個模型一個被限流、一個仍被凍結,商業發布受制于政府窗口。在這個背景下發布 Sonnet 5,并著重強調它的代理能力「接近 Opus 4.8」,邏輯變得連貫了——被壓住的旗艦序列無法正常鋪開,那就讓中端產品撐起當下的商業需求。
這不是 Anthropic 第一次在監管和商業節奏之間做騰挪。今年 6 月它還在首爾開設了新辦公室,持續推進在韓國市場的本地化合作。一邊是旗艦被美國政府拴住,一邊是國際市場還在推進,兩條線并行,內部的協調壓力可想而知。
03
Claude 的 AI4S
Claude Science 是今天另一條更安靜但可能更持久的線索。
它的形態是「AI 工作臺」,整合了 60 多個科學數據庫和專用工具包,核心不是一個新模型,而是一套工作流。底層調用的還是 Opus 4.8 這類現有模型,但外面包了一層專門為科研設計的環境——生成可審計的產物、靈活的計算資源接入,以及一個 Anthropic 特別強調的功能:
可復現性。
每張圖表都附帶生成它的完整代碼、運行環境、純語言說明,以及完整的消息歷史。研究人員數月后還能追溯任何結果的來源。在學術界,可復現性危機已經吵了十幾年,AI 工具如果能系統性地把這個痛點嵌入工作流,對科研群體的吸引力不會小。
![]()
Claude Science 的工作頁面|圖片來源:Anthropic
Anthropic 宣布會支持最多 50 個 Claude Science 科研項目,每個項目提供最多 3 萬美元的計算積分,合作方 Modal 另外提供最多 2000 美元的計算資源。這個量級不算大,更多像是在圈定早期用戶群體、跑通模式。
今年 4 月,OpenAI 發布了 GPT-Rosalind,一個針對生物推理微調的專門模型,當時以研究預覽形式推出,訪問權限限于美國境內的合格企業客戶。
兩家的策略分叉明顯——OpenAI 選擇了定制模型,Anthropic 選擇了工作流整合。哪條路更適合科研場景,目前還很難判斷,但 Anthropic 的邏輯有一定說服力:大多數科學家并不缺一個更聰明的模型,他們缺的是一個能把數據庫、工具、代碼環境和結果審計串在一起的穩定工作臺。(或者說,他們缺的是不用每次打開五個窗口互相復制粘貼的工作流——這大概是今天科研圈最普遍的日常。)
04
從模型競賽到系統競爭
整個 AI 行業在過去一年里經歷了一次微妙的敘事轉移。
2024 年之前,模型發布基本等于「性能排行榜」的一個新條目,討論焦點是參數量、基準分數、上下文窗口。而現在,頭部公司發布新模型時越來越多地在談「總體擁有成本」「工作流集成」「代理任務的可靠性」,基準測試退到了配角位置。
Sonnet 5 和 Claude Science 是這個趨勢的一個切片。前者的核心價值不是「更聰明」,而是「用更低的成本做到足夠聰明」;后者的核心價值不是「新模型」,而是「把模型接進你本來的工作環境」。
業內有一種觀點正在變成共識:性能競賽對大多數實際應用場景來說已經走到了一個拐點,絕大多數企業用戶需要的能力,現有的中端模型基本都夠用,剩下的差異化要靠成本、可靠性和生態集成來決定。
Anthropic 今天的兩個發布,一個往左,一個往右,一個對準開發者和企業的代理場景,一個對準科學家的專業工作流,看起來像是在同時押注兩個方向。但更準確的理解或許是:它在測試,當模型本身不再是主要壁壘的時候,什么才是留住用戶的真正理由。
Fable 5 的訪問權限還沒恢復,下一步怎么走還要等政府那邊的窗口。但在等待窗口打開之前,中端產品線和垂直工具的版圖已經先鋪出去了。
*頭圖來源:Anthropic
本文為極客公園原創文章,轉載請聯系極客君微信 geekparkGO
極客一問
AI 模型的競爭終點是「性能天花板」,
還是「誰先讓大多數人用得起、用得順」?
![]()
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.