![]()
冷知識,昨天是奧特曼看到原子彈爆炸一周年
今天,Claude Opus 5 發布了
第一感覺是:Anthropic 終于把 Fable 5 的能力,做成了可以長期使用的模型
我之前體驗 Fable 5,能力確實很強,但是貴的離譜
這種模型更像是 Anthropic 用來展示能力上限的,偶爾體驗一下可以,真拿來跑 Claude Code、Cowork 和各種 Agent 工作流,我肯定舍不得
Opus 5 就現實多了
價格繼續保持 Opus 4.8 的水平,輸入每百萬 Token 5 美元,輸出 25 美元,但是能力已經非常接近 Fable 5。官方公布的 CursorBench 3.2 只差 0.5%,OSWorld 2.0 甚至用大約三分之一的成本超過了 Fable 5,Fast Mode 速度還能提升到默認模式的 2.5 倍。
這個官方圖表居然還有標紅錯誤,Agentic coding 那里 53.4% > 53.5%
![]()
當然,Benchmark 看看就好
我反而覺得 Opus 5 釋放了一個更明確的信號:現在大模型競爭的重點,正在從“誰能做出最驚艷的答案”,轉向“誰更適合被大量、反復地調用”
過去發布一個旗艦模型,大家先看它有沒有刷新榜單,推理又提高了多少分。現在真正用 Agent 的人更關心的是:一個任務到底要跑多少 Token、需要返工幾次、中途會不會跑偏,最后能不能不靠人盯著把事情做完
一個模型單次調用便宜,不代表整個任務真的便宜
尤其是 Claude Code 這類 Agent 場景,模型如果理解錯一次需求、改錯幾個文件,或者跑到一半忘了驗證,后面消耗的 Token 和人工時間可能遠遠超過模型本身的差價
所以 Anthropic 這次反復強調的 judgment,我覺得比那些 Benchmark 數字更有意思。
現在不少模型寫代碼已經很強了,但是 Agent 真正干活時,問題往往不是“不會寫”,而是太容易覺得自己已經寫完了
需求有沒有真正理解,Bug 是不是只修了表面,頁面在手機端會不會跑出去,結果有沒有實際驗證,很多模型都需要人在后面不停提醒
Opus 5 這次重點提升的恰好就是這些:它會主動檢查需求、尋找根因、運行測試,必要時甚至自己補一個工具來驗證結果,而不是代碼能運行就急著宣布任務完成
這也解釋了為什么 Opus 5 看起來沒有 Fable 5 那么“炸”
Fable 5 更像是 Anthropic 為少數高價值、超長周期任務準備的能力上限,適合那些成本不是第一優先級、模型需要自主運行很久的工作;Opus 5 則明顯是面向更普遍的編程、辦公和企業 Agent 場景
不是每個任務都需要最聰明的模型,但大多數任務都需要一個足夠聰明、價格可以接受,而且不需要你一直跟在后面擦屁股的模型
從這個角度看,Opus 5 可能不是 Anthropic 最驚艷的一次更新,卻可能是目前最適合真正干活的 Claude
Fable 5 負責告訴大家天花板有多高,Opus 5 開始負責把這套能力真正賣出去
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.