即將推出的月之暗面 K3 已在社交媒體上刷屏。
各方面信息顯示,Kimi K3 將是中國迄今為止最大的人工智能模型,參數(shù)規(guī)模達(dá) 2.8 萬億。
與之相比, Anthropic Opus 4.8 參數(shù)規(guī)模為 1.5 萬億至 2 萬億。
![]()
![]()
同時(shí),K3 將采用 Open Weight(開放權(quán)重) 的方式發(fā)布,允許開發(fā)者下載、部署和修改模型權(quán)重,而不是僅提供 API 服務(wù)。
這意味著,K3 不僅將在模型規(guī)模上超過目前已知的大多數(shù)中國模型,也將成為全球最大的開放權(quán)重基礎(chǔ)模型之一。
![]()
根據(jù)月之暗面官方Kimi K3技術(shù)文檔,在 GDPval-AA v2 排行榜上,K3 獲得1687 分。該榜單用于評估 AI 模型在覆蓋 9 大行業(yè)、44 種職業(yè)的真實(shí)世界知識工作任務(wù)中的表現(xiàn)。
Kimi K3 的成績僅次于 Claude Fable 5 Max 和 GPT-5.6 Sol Max,并超過了 Claude Opus 4.8 Max 的 1600 分。
在 AA-Briefcase 基準(zhǔn)測試中,Kimi K3 獲得了 1527 分,在所有模型中排名第二,僅次于 Claude Fable 5 Max,同時(shí)超過了 GPT-5.6 Sol Max(1495 分)。
AA-Briefcase 是由 Artificial Analysis 開發(fā)的一項(xiàng)專有 Agent 知識工作評測基準(zhǔn),用于衡量當(dāng)前最先進(jìn) AI 模型在長期知識工作場景中的 Agent 能力。
K3 最令人關(guān)注的另一項(xiàng)能力來自長上下文。
月之暗面表示,依托 100 萬 Token(1M)上下文窗口,Kimi K3 在 BrowseComp 上取得 91.2 分,達(dá)到新的 SOTA(State of the Art),擊敗 GPT 5.6 Sol Max 和 Fable 5 Max。
![]()
官方特別強(qiáng)調(diào),這一成績是在單 Agent 設(shè)置下完成的,不需要上下文壓縮,也不需要額外的上下文管理系統(tǒng),體現(xiàn)了模型在超長知識檢索、復(fù)雜資料分析以及長期任務(wù)執(zhí)行上的能力。
對于越來越強(qiáng)調(diào) Agent 的行業(yè)來說,這比傳統(tǒng)數(shù)學(xué)或編程基準(zhǔn)更有現(xiàn)實(shí)意義,因?yàn)檎鎸?shí)企業(yè)場景往往需要模型連續(xù)閱讀數(shù)百頁文檔、跨多個(gè)來源檢索信息,并持續(xù)完成長時(shí)間任務(wù)。
性能達(dá)到高端旗艦水平的同時(shí),月之暗面在定價(jià)上的策略更值得關(guān)注。
圖表可見,其相比 k2.6 漲幅明顯,且價(jià)格直接對標(biāo)Sonnet 5 。
![]()
![]()
看來月之暗面開始拋棄”極致性價(jià)比”路線,而是進(jìn)入高端旗艦定價(jià)水平,開了中國大模型的新風(fēng)氣。
最新消息是, BridgeMind 在 X 上披露稱,Kimi K3 剛剛在 BridgeBench Horror House 游戲測試中擊敗了 Fable 5,“完全沒有料到這一點(diǎn)”。
尤其 Kimi K3 在游戲開發(fā)和 UI 設(shè)計(jì)方面優(yōu)于 Fable 5,而“這兩項(xiàng)原本是 Fable 5 的專長”。
所以,K3 的“價(jià)格上漲突然變得合理了”。
![]()
有網(wǎng)友發(fā)帖驚呼,盡管稍遜色,但 K3 基本上與 Fable5 相當(dāng),超過 GPT- 5.6,“是又一個(gè) DeepSeek r1”時(shí)刻!
![]()
更多網(wǎng)友則在親測后表示,K3 已經(jīng)超過 Fable 5,尤其前端設(shè)計(jì)方面。
![]()
![]()
英國《金融時(shí)報(bào)》認(rèn)為,K3 的推出可能挑戰(zhàn)過去業(yè)內(nèi)長期存在的一種共識——中國前沿 AI 模型整體落后美國 8 至 12 個(gè)月。
報(bào)道指出,雖然美國模型在最復(fù)雜任務(wù)上仍保持領(lǐng)先,但越來越多美國科技投資人與企業(yè)高管開始認(rèn)為,這一差距正在迅速縮小。
Andreessen Horowitz 聯(lián)合創(chuàng)始人 Marc Andreessen 上個(gè)月就在 X 上評價(jià)中國模型時(shí)寫道,“GLM-5.2 是第一個(gè)與美國大型實(shí)驗(yàn)室公開 AI 模型不相上下,甚至經(jīng)常更勝一籌、沒有任何妥協(xié)的中國 AI 模型。”
《金融時(shí)報(bào)》認(rèn)為,K3 的出現(xiàn)將進(jìn)一步強(qiáng)化這一趨勢。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.