![]()
7月16日晚,月之暗面扔出了K3。2.8萬億參數(shù),F(xiàn)rontend Code Arena 1679分,壓過了Claude Fable 5的1631分。7月27日前,完整權重開源。
官方博客里有句話很少見:"整體表現(xiàn)仍落后于最強的閉源模型Claude Fable 5和GPT-5.6 Sol,但在我們的整套評測中展現(xiàn)出前沿水平的能力,并穩(wěn)定超過了其他所有模型。"
這種坦誠在國產(chǎn)大模型發(fā)布里算一股清流。它不裝全能,只告訴你:我在編程這個主戰(zhàn)場上,已經(jīng)坐到了最靠前的位置。
![]()
1679分,X上先炸了
消息放出來后,X上的時間線被K3刷屏。海外開發(fā)者這次沒當看客,直接把它當成生產(chǎn)力工具來測。
震撼派
Guillermo Rauch,Vercel的CEO,做了nextjs.org的綜合Web工程評測。他的結論很直接:K3領先Fable,開放模型第一次領先全部專有模型。這測的是真實工程能不能交付,不是算法題。Rauch還補了一句:榜單不能講完全部故事,最強模型的任務完成率也沒有達到100%。
![]()
Arena.ai的數(shù)據(jù)更直觀:Frontend Code Arena 1679分,排名第1。K2.6之前排第18,K3直接躍升了17位。7個前端領域,6個第一。
Artificial Analysis給了獨立評測:綜合指數(shù)57,與Claude Opus 4.8、GPT-5.5處于接近區(qū)間;AutomationBench-AA得分53%居首;長程知識工作Elo 1547,僅次于Fable 5。任務成本約0.94美元,低于Opus 4.8。
![]()
連馬斯克都在Artificial Analysis的推文下留了句"Impressive"。
![]()
Sriram Krishnan的評價更宏觀:他把K3稱為"對整個行業(yè)具有多重影響的重大時刻"。
Emad Mostaque更直接:"美國實驗室最終會去蒸餾中國模型。"
冷靜派
但海外沒被沖昏頭腦。Simon Willison做了他的經(jīng)典鵜鶘SVG測試。K3的結果較K2.5明顯提升,圖像理解也很好;但簡單任務消耗了1.6萬余輸出Token,其中約1.32萬是推理Token,成本約0.25美元。推理Token使用很重,效率邊界仍待觀察。
![]()
Ivan Fioravanti在兩項真實項目里稱贊了K3的UI、設計和速度,認為它較好地遵循指令;但指出模型"投入較多思考,偶爾越界加戲"。它會自行擴展任務范圍,而不是嚴格停在用戶劃定的邊界里。
![]()
Bindu Reddy更直接:提醒K3榜單成績"過于突出",仍需用更難污染的測試繼續(xù)驗證。尚不能稱為Opus級,特別是在長上下文、多輪、復雜Agent循環(huán)中。
![]()
Redis作者antirez把K3放在開放權重模型快速進步的大背景里,同時強調(diào):需要長期真實結果才能判斷模型水平與實際貢獻。
X上的反應分成兩派,但兩派都承認一件事:K3讓全球AI從業(yè)者不得不重新評估中國開源模型的位置。它已經(jīng)從"便宜替代品"的選項,變成了一個需要認真對比的生產(chǎn)力工具。
從"便宜能用"到"貴得有道理"
如果把中國AI開源模型的全球沖擊排個序,K3大概是第三次。
第一次是DeepSeek。年初R1以低成本、高效率震動全球,證明中國模型能在有限算力下做出頂尖性能。路線是"普惠",讓全球開發(fā)者用得起。DeepSeek的定價策略是"量大管飽",用極致性價比撕開市場。
第二次是GLM。國內(nèi)頭部模型ARR半年從1億飆到10億,Code Arena盲測全球可用模型第一,證明中國模型能賺錢。路線是"商業(yè)閉環(huán)",用快速變現(xiàn)證明商業(yè)模式跑得通。
第三次是K3。2.8T參數(shù),F(xiàn)rontend Code Arena第一,7月27日開源完整權重。這是中國開源模型第一次同時在參數(shù)規(guī)模、前沿性能和全球開發(fā)者聲量上沖擊第一梯隊。
![]()
三次沖擊,三條路線。DeepSeek證明"能便宜",GLM證明"能賺錢",K3證明"能貴得有道理"。
這背后是一個更深層的變化:中國AI開源陣營正在從"速度套利"轉向"價值定價"。過去12個月里,有9個月開源模型的參數(shù)上限由Kimi保持。K3算不上突然冒出來的,它是一條連續(xù)路線的終點。從K2的1萬億參數(shù)到K3的2.8萬億,架構上是自研KDA混合線性注意力加上Attention Residuals,再配上MoE(896個專家激活16個),擴展效率提升約2.5倍。
7月27日開源2.8T,但絕大多數(shù)開發(fā)者根本跑不起來。即使做了量化,本地部署也需要多張高端顯卡。所謂"開源",更像是開放一份"行業(yè)標準參考書"。
說白了,開源是廣告牌,API是收費站。你看得到、學得到,但用不起,最終還得回來找我。把KDA貢獻給vLLM社區(qū),是在買生態(tài)門票。產(chǎn)業(yè)界早就在用這套玩法:輸出技術標準、建立開發(fā)者認知、降低試用門檻,最終把流量導向API。
貴有貴的代價
K3的"性格"很鮮明。它愿意投入大量推理換交付質(zhì)量,但簡單任務里顯得"用力過猛"。
Fioravanti在真實項目里發(fā)現(xiàn),K3"投入較多思考,偶爾越界加戲"。它會自行擴展任務范圍,而不是嚴格停在用戶劃定的邊界里。Willison的實測更量化:簡單任務消耗1.6萬余輸出Token,其中約1.32萬是推理Token,成本約0.25美元。默認max模式下,推理Token占比極高。
這更像是K3自帶的工作風格。它假設用戶愿意為交付質(zhì)量付溢價,所以默認拉滿推理鏈條。但問題是:簡單任務不需要這么重的思考。未來能不能在harness上做得更好、更節(jié)省Token,知道什么時候該停、什么時候該用力,是K3的下一道門檻。
![]()
Token燒得快,意味著實際成本比賬面價格更高。緩存命中0.30美元看起來很香,但默認模式下推理Token占比極高,簡單任務也能燒出0.25美元。如果控制不好停止條件,成本會快速膨脹。Artificial Analysis的獨立頁面也指出,K3速度低于同檔平均、輸出偏冗長。
K3走的不算普惠路線,更像生產(chǎn)力工具路線。它假設用戶是愿意為好結果付溢價的企業(yè)開發(fā)者,不是追求極致性價比的個人用戶。
價格確實貴。API輸出漲到15美元,未命中輸入3美元,對比國產(chǎn)同行(DeepSeek、混元Hy3僅1元/百萬token)明顯更高。但第三方實測K3成本僅為Fable 5的四分之一。"貴"是相對于國產(chǎn)模型,相對于海外旗艦它依然是"高端性價比"。
Kimi選了更難走、也更值錢的那條路。DeepSeek讓全球開發(fā)者用得起,Kimi讓全球開發(fā)者用得好。兩條路沒有高下,但K3證明了一件事:中國AI不僅能"便宜",還能在高端生產(chǎn)力場景里卡位。
當然,差距還在。官方自己承認整體落后Fable 5和GPT-5.6 Sol。Bindu Reddy提醒榜單需驗證,antirez強調(diào)"要看長期真實結果"。在前端編程和Agent任務上,K3驚艷;在復雜統(tǒng)計和長程Agent循環(huán)上,它仍有明顯距離。
"局部領先、全局追趕"是K3最準確的畫像。K3算不上穩(wěn)妥的聊天機器人,它更像一個愿意主動行動、更擅長交付視覺結果、也更需要校驗停止條件的Agent模型。
小小震撼,剛剛好
K3沒有宣稱全面超越,它只是在特定戰(zhàn)場證明中國開源模型可以坐第一排。X上的熱議、Vercel CEO的背書、外媒的"下一個DeepSeek時刻",這些反饋本身說明,K3讓全球AI從業(yè)者不得不重新評估中國模型的位置。
有震撼也有遺憾,有領先也有短板。這種"剛剛好"的真實感,比任何"全面碾壓"的宣傳都更有說服力。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.