出品 | 網易智能
作者 | 小爪
編輯 | 王鳳枝
模型越強,排行榜反而越難告訴我們該選哪個。
7月19日,月之暗面的Kimi K3登上Arena網頁前端開發榜首,得分約1677。而在Artificial Analysis的綜合智能指數,它得到57分,在186款模型中排第四,在國產模型和開源模型中排名第一。
Arena這張分榜記錄的是用戶更喜歡哪個模型生成的網頁,Artificial Analysis的綜合智能指數則匯總多項評測。月之暗面在官方技術博客里也承認,K3的綜合表現仍落后于Claude Fable 5和OpenAI的GPT-5.6 Sol。但和這兩家的差距,比半年前的國產旗艦縮小了一截。
網頁做得漂亮、事實答得準、跑得便宜、跑得穩,這是四件事,不是一件事。 K3兩張成績單上的排名差,只是最表面的一層。但更多的錯位藏在排名背后:跑一次要花多少錢、結果能不能直接用。
第一名,只在一張榜上
Arena沒有固定試卷。用戶向兩個匿名模型發出同一個要求,看完結果后投票,平臺再匯總大量兩兩對戰,計算分數和排名。
![]()
這種方法離真實使用更近。網頁有沒有做完、布局順不順眼、交互是否合意,用戶一眼就能比較。K3排到第一,說明在這一批網頁開發對戰中,它贏得了更多選擇。
當然,投票也會把審美帶進成績。一張視覺更完整、動畫更豐富的頁面可能勝出。放到普通問答里,寫得長、顯得篤定的答案同樣可能討喜,但答得對不對,用戶不一定投得出來。
Arena因此給分數附上置信區間。兩個模型的區間重疊,名次的先后未必穩定。新模型上線后,成績還會被標為"初步",等待更多投票。K3當前的網頁前端榜首就帶著這一標記。
題目來源也在變。2026年5月,Arena把部分直接對話中的模型對戰納入榜單。平臺隨后發現,新票源里的問題更長,復雜指令和編程任務更多。模型沒有更新,換一批提問者,分數也可能移動。
真要選模型,用戶還得面對賬單、等待時間和失敗后的返工。
分數之外,還有賬單和返工
Kimi K3官方API的價格為:緩存未命中的輸入每百萬token 3美元,輸出每百萬token 15美元。Artificial Analysis跑完整套智能指數評測時,K3生成約1.3億個輸出token,接近同類參評模型平均值6300萬的兩倍;整套測試花費約2710美元。該機構記錄的輸出速度約為每秒39.5個token。
按完成一項評測任務折算,K3平均花費約0.94美元,低于GPT-5.6 Sol的1.04美元,約為Claude Opus 4.8的1.80美元的一半。與上一代K2.6相比,K3的輸出token減少約21%。
單價便宜不等于賬單便宜。K3的輸出token數接近同類平均值的兩倍。單價再低,總量也會把賬拉起來。
賬單之外,還有結果能不能直接用。
![]()
在Artificial Analysis的AA-Omniscience測試中,K3的準確率由K2.6的33% 升至46%,幻覺率也從39% 升至51%。準確率看的是全部題目里答對了多少,幻覺率看的是答錯的題目里模型是編了一個答案還是承認不知道。K3答對的比例提高了,但在仍然沒答對的題目里,它更傾向于直接給出錯誤答案而非承認不知道。
開發者西蒙·威利森(Simon Willison)做過一個很小的測試:讓K3生成一張"鵜鶘騎自行車"的SVG圖片。模型用了16658個輸出token,其中13241個是推理token,費用約0.25美元。這個例子無法代表K3的整體效率,卻很像用戶會遇到的真實瞬間,任務看著不大,模型在后臺想了很久。
![]()
月之暗面目前讓K3默認使用最高推理強度,稱后續版本將提供低、高推理模式,讓用戶控制推理預算。想多久、花多少錢,最終還是用戶自己決定的事。
模型在進步,試卷也在過期
K3目前的成績主要來自Arena和Artificial Analysis,尚未在SWE-bench類固定題庫上公布分數。但固定題庫本身的可信度也在下降,因為模型越強,越容易接近試卷上限;題目在網上放得越久,進入訓練數據的機會也越大。
今年2月23日,OpenAI宣布不再使用SWE-bench Verified衡量前沿編程模型。該公司審計了138道模型經常失敗的題目,稱其中59.4% 存在實質性的題意或測試設計問題。有些測試只接受一種特定寫法,把功能正確的其他答案判錯;還有些題目沒有寫清要求,測試卻檢查額外功能。
![]()
OpenAI稱,它在GPT-5.2、Claude Opus 4.5和Gemini 3 Flash Preview中發現訓練數據污染跡象:模型有時能夠復現人類原始補丁或題目細節。OpenAI認為,在這些測試獲得的高分里,模型可能受益于對訓練數據中原始補丁或題目細節的熟悉,而非純粹的能力。
就在此前的2月18日,一篇分析60個大模型基準的預印本研究也指出,許多固定評測在頭部模型接近滿分后,區分能力會下降。
把題目換成真實工作,差距更為明顯。METR在2026年5月19日發布的回顧報告中稱,截至2025年末,被SWE-bench Verified判定通過的AI代碼方案,大約只有一半會在真實代碼審查中被接受。 Arena記錄用戶偏好,固定題庫適合追蹤某項能力,METR試著測量模型可以獨立完成多長的任務。三張榜,各管一段。
第一名需要一個后綴
面對數百款模型,榜單能幫用戶快速縮小范圍。但麻煩的是,"某模型登頂"這種說法,并不考慮任務類型和成本。
寫作、做網頁、維護代碼不是一回兒事;人類偏好、標準答案、任務成功率不是一個指標;token用量、耗時、單價也各算各的賬。
到最后,模型還得放回自己的提示詞、數據和工具鏈里跑一遍。寫作者關心事實準不準、要不要大改;程序員看代碼能不能進真實倉庫;企業算的是一件工作交付后的總成本。沒有一個榜首可以同時替這三類人作決定。
Kimi K3拿下網頁前端榜首,說明它在這項能力上已經進入前沿。綜合指數第四、較高的token消耗,以及準確率和幻覺率同時上升,則補上了另外幾面。這些成績放在一起,才像一個可以拿來選型的模型畫像。
模型榜單不會消失,但"第一名"三個字需要越來越長的注釋。真要付賬單的人,看的是能不能交付、花多少錢、要回來改幾次,冠軍兩個字,解決不了你的具體問題。
Kimi K3現在暫停接受新增訂閱,想訂的人得等下一批。等真能訂上的時候,這些問題還得再問一遍。
