震動美股的Kimi K3,到底有多強?
實測的這幾天,我們用K3復(fù)現(xiàn)了券商研報、搭建了實時選題監(jiān)控系統(tǒng),甚至用一段提示詞和一張參考截圖做出了一個有六種3D魚類的“大魚吃小魚”游戲。
但這些,可能還沒發(fā)揮出K3真正的水平——
有人用它在2小時內(nèi)完成了一項通常需要天體物理研究員兩周的計算,期間還發(fā)現(xiàn)了已發(fā)表論文中的公式問題。有人讓它連續(xù)自主運行48小時,用開源EDA工具獨立完成了一顆芯片的設(shè)計和驗證。還有人三輪對話做出了一個可玩的CS:GO克隆,總成本只花了3美元稍稍出頭。
7月17日,月之暗面發(fā)布Kimi K3。2.8萬億參數(shù),原生視覺理解,100萬token上下文窗口。完整權(quán)重將于7月27日開放下載,屆時它將成為全球參數(shù)量最大的開源權(quán)重模型。
Arena AI前端代碼競技場,K3以1679分登頂全球第一,超過Claude Fable 5的1631分和GPT-5.6 Sol的1618分。
![]()
值得一提的是,這張榜和實驗室里跑出來的分?jǐn)?shù)不同。它用的是Elo對戰(zhàn)機制,和國際象棋排名同一套邏輯:真實開發(fā)者提交真實的前端編程任務(wù),兩個匿名模型各交一份代碼,開發(fā)者盲選更好的那個。投票的人,不知道自己在給誰投票。由于模型身份被隱藏,這類盲測能削弱品牌印象對投票的影響,比廠商自報的榜單更接近真實用戶偏好。
而Kimi K3,首秀即登頂,勝率達(dá)到了76%,領(lǐng)先Fable 5整整48分。品牌營銷、參考設(shè)計、數(shù)據(jù)分析、消費產(chǎn)品、模擬、內(nèi)容創(chuàng)作、游戲這七個細(xì)分方向中,K3拿下六個第一,僅游戲類排名稍稍落后于Fable 5。
Vercel創(chuàng)始人Guillermo Rauch同樣確認(rèn),K3在Next.js工程評測中排名第一,并稱這是"首次有開源模型超越全部閉源模型";馬斯克看完評了一個詞:Impressive;摩根士丹利、高盛、Bernstein等國際頂尖投行用完連發(fā)數(shù)篇研報,從各個角度"花式夸夸"。
![]()
那么,Kimi K3的真實表現(xiàn)到底是夯了還是拉了?不妨從我們的一手實測說起。
![]()
一手實測:很強,還很有審美
我們給K3的第一個任務(wù)不是寫段代碼或畫個界面,而是讀懂一份60多頁的券商宏觀深度報告,然后把里面描述的研究方法論復(fù)現(xiàn)成一套可運行的系統(tǒng),看看它能不能幫諸多金融從業(yè)者解決高頻的“研報復(fù)現(xiàn)”工作。
復(fù)現(xiàn)一份研報的完整方法論
恰好,我們在刷研報的時候看到了一篇需要"四角色線性流水線"復(fù)盤報告生產(chǎn)體系:新聞收集員從華爾街見聞等源采集事件,數(shù)據(jù)底稿工程師校驗14個Sheet的完整性和數(shù)據(jù)口徑,研報撰寫員只讀底稿生成復(fù)盤報告,合規(guī)審查員執(zhí)行七項審查并擁有最終否決權(quán)。四個角色依次執(zhí)行,前一個不完成后一個不啟動。
![]()
K3讀完P(guān)DF后,按照我們的要求先輸出了需求分析和產(chǎn)品設(shè)計文檔,然后自行拆出兩條并行開發(fā)線分頭推進(jìn)。
最終,kimi交付了一整套Python工程:四個Agent角色、十多個專業(yè)工具(雙源新聞采集、四維度事件分類與雙重去重、底稿校驗與口徑同步、月度復(fù)盤撰寫、三情景展望框架、合規(guī)七項審查),以及一個可本地運行的Web服務(wù)和配套的自動化測試。
![]()
我們用黃金ETF 2026年5月的案例跑了一遍完整流水線。結(jié)果顯示,系統(tǒng)從2233+865條原始新聞中篩選出76條底稿事件(資產(chǎn)配置23、貨幣16、避險28、商品9),生成了一份帶走勢三段式復(fù)盤、事件逐條點評和三情景概率展望的月度報告。數(shù)據(jù)口徑與研報原文對齊,合規(guī)審查七項全部通過。
![]()
一份PDF進(jìn)去,一套可運行的研究體系出來。對于這類需要同時理解金融邏輯、系統(tǒng)架構(gòu)和工程實現(xiàn)的復(fù)合型任務(wù),K3展現(xiàn)出的理解深度超出了我們的預(yù)期。
一段提示詞做一個3D游戲
我們給K3下了一段提示詞,附了一張游戲操作面板的參考截圖,讓它做一個3D海底世界的"大魚吃小魚"游戲。
![]()
K3的做法是先拆后合。它自行拆出兩條并行工作線——一條負(fù)責(zé)海底場景和UI,另一條負(fù)責(zé)魚類模型和玩法邏輯——分頭開發(fā),然后合并集成。
最終,kimi交出來的是一個完整度很高的3D網(wǎng)頁游戲作品:6種程序化生成的魚類(從小丑魚到鯊魚,每種有獨立的體型、配色和游動行為),玩家操控一只虎鯨在海底吞噬比自己小的魚,躲避大魚,不斷升級。HUD采用毛玻璃面板設(shè)計,配色是低飽和的海洋藍(lán)綠色調(diào),左上角血條、能量條、等級進(jìn)度,右下角技能按鈕,甚至做了移動端虛擬搖桿適配和非常精致的音效。
![]()
代碼寫完后,K3還會拉起運行畫面的截圖,根據(jù)視覺缺陷反復(fù)修改,直到畫面正常、可以流暢游玩。這種能力,被Kimi官方稱為vision in the loop。
坦白講,拿到這個游戲的時候我們是有點吃驚的。不是因為"AI能做游戲"——這件事去年就有人演示過了——而是它交出來的東西有審美、有完成度,不像是AI臨時拼湊的demo,倒更像是一個有設(shè)計意識的小團(tuán)隊花幾天打磨出來的原型。
審美,可能是K3最被低估的能力
以上這些案例驗證的是K3的工程能力。但在實測過程中,反復(fù)給我們留下印象的還有另一件事:它做出來的東西,和宣發(fā)視頻一樣高級,一樣有審美。
使用K3的這些天里,我們用它制作了非常多高級、有質(zhì)感的網(wǎng)站前端。社區(qū)里更有人做了一個黑洞引力透鏡的交互可視化頁面、有人僅用一段參考視頻讓K3復(fù)刻了出了精致細(xì)膩的Blender資產(chǎn),效果精致到讓不少從業(yè)者感嘆"這個模型是不是偷偷讀了個藝術(shù)碩士"。
![]()
![]()
甚至能用它設(shè)計芯片
我們體驗的主要是金融、媒體等領(lǐng)域的日常開發(fā)場景,而全球社區(qū)諸多大神們,把K3帶去了更頂尖的領(lǐng)域——科研、芯片設(shè)計、編譯器...這些對頂級閉源模型都非常有挑戰(zhàn)性的領(lǐng)域。
科技記者M(jìn)ax Weinbach讓K3 Agent集群在瀏覽器中重建了macOS 27的Liquid Glass界面。3小時自主執(zhí)行后,產(chǎn)出了一個完整的瀏覽器版macOS:所有按鈕可點擊,內(nèi)置Chess游戲?qū)嶋H可玩,低電量模式甚至?xí)档推聊涣炼取?/p>
![]()
還有一位開發(fā)者做了件更有想象力的事:他沒有讓K3做一個游戲,而是讓K3做了一臺“游戲機”——含卡帶插槽、物理按鍵,插入一盤電子《逆轉(zhuǎn)裁判》風(fēng)格的卡帶就能玩,風(fēng)格極其逼真。
![]()
成本方面,獨立評測平臺TestingCatalog實測K3與Fable 5做同一款游戲:K3花費$3.11,F(xiàn)able 5花費$12.23,約為后者的四分之一。
![]()
還有個開發(fā)者僅用三輪對話就生成了一個可玩的CS:GO克隆,總API成本僅3.24美元,約23元人民幣。對比來看,同類任務(wù)在Fable 5上要花約9美元。
官方展示的案例同樣令人印象深刻:K3從零搭建了一套完整的GPU編譯器MiniTriton,性能在基準(zhǔn)測試中持平甚至超過了Triton和torch.compile;連續(xù)自主運行48小時,獨立完成了一顆芯片從設(shè)計到驗證的全流程。
![]()
甚至,在K3開發(fā)后期,月之暗面團(tuán)隊把大部分kernel優(yōu)化工作交給了K3的早期版本——沒錯,這個頂級AI在優(yōu)化自己。值得一提的是,K3發(fā)布不到48小時,月之暗面就因爆火“斷供”。由于用戶涌入量遠(yuǎn)超預(yù)估,集群負(fù)載直接逼近極限,7月19日,公司宣布主動暫停C端新用戶訂閱,將全部算力優(yōu)先保障已訂閱用戶體驗,同時緊急推進(jìn)擴容。
![]()
2.8萬億巨獸和它的設(shè)計哲學(xué)
模型做到2.8萬億參數(shù),難的不是參數(shù)本身,是信息如何在這個規(guī)模下不丟、不亂、不慢。K3在架構(gòu)上做了兩件事。
第一件是Kimi Delta Attention(KDA),解決長度問題。傳統(tǒng)注意力機制處理長文本時,每遇到新內(nèi)容都要回頭查閱全部原文,文本越長計算代價越大。KDA的做法是邊讀邊記筆記:新信息寫進(jìn)去,不再重要的逐漸淡化,多數(shù)時候查筆記就夠,必要時再翻原文。這讓K3在百萬token上下文窗口下的解碼速度提升了6.3倍。
第二件是Attention Residuals(AttnRes),解決深度問題。模型內(nèi)部上百層,信息逐層向后傳遞。傳統(tǒng)做法相當(dāng)于接力改稿,每個編輯只看上一版,改了上百輪后早期的關(guān)鍵判斷很容易被淹沒。AttnRes讓后面的層可以有選擇地直接檢索前面各層的信息,按需取用。
兩項技術(shù)配合Stable LatentMoE框架(總共896個專家,每次僅激活16個),K3整體擴展效率比上一代K2提升了約2.5倍。
![]()
三家投行連夜發(fā)研報
K3發(fā)布不到24小時,反響已經(jīng)從技術(shù)社區(qū)蔓延到了資本市場。
PyTorch聯(lián)合創(chuàng)始人Soumith Chintala稱K3為"世界級模型"。前美國AI政策顧問Sriram Krishnan評價這是"對整個行業(yè)有重大影響的時刻"。Stability AI創(chuàng)始人Emad Mostaque更直接:"美國實驗室最終會蒸餾中國模型。"楊植麟的博士生導(dǎo)師、CMU機器學(xué)習(xí)教授Russ Salakhutdinov發(fā)帖稱K3"為開源社區(qū)帶來了重大突破"。
資本市場上,三家投行的觀點也很有看點。
摩根士丹利在7月17日研報中,將K3定位為中國LLM"在模型規(guī)模、性能和定價上全面追趕美國領(lǐng)導(dǎo)者"的信號。大摩特別指出:"我們不認(rèn)為K3是一夜奇跡,而是中國AI產(chǎn)業(yè)累積進(jìn)步的結(jié)果。"報告同時預(yù)期,下半年將有更多2到5萬億參數(shù)的中國模型發(fā)布。
![]()
高盛7月18日的研報用了一個更大的判斷:中國AI開源模型"正在達(dá)到全球擴散的智能臨界點"。K3把API定價抬到了中國模型中最高的水平(混合約$2.3/百萬token),但仍只有Claude Fable 5的約三分之一。在高盛的框架中,評估AI模型公司競爭力的三個核心指標(biāo)是定價權(quán)、成本效率和財務(wù)實力,K3在前兩項上給出了新的標(biāo)桿。
高盛在隨后的報告中分析稱,DeepSeek代表成本效率,Kimi K3代表新的能力前沿和定價權(quán) 。該機構(gòu)表示,K3的API定價已是中國模型中最高的水平(混合約$2.3/百萬token),仍只有Claude Fable 5的約三分之一,但徹底告別了過去的"白菜價"模式。高盛認(rèn)為,中國開源模型的智能水平正在達(dá)到面向全球擴散的臨界點:過去靠性價比入場,下一階段,可能憑借前沿能力進(jìn)入全球開發(fā)者的核心工作流。
![]()
Bernstein最為直接:"K3 a home run。"研報重新排列了中國AI實驗室的SOTA排名,將Kimi列為新的領(lǐng)頭羊,并測算K3比Opus 4.8便宜約40%,比Fable 5便宜約70%。
![]()
來到具體的市場表現(xiàn)。K3發(fā)布當(dāng)日,納斯達(dá)克100指數(shù)期貨跌逾1.8%,日經(jīng)225指數(shù)跌逾4%。Polymarket上,Anthropic年底估值達(dá)$1.5萬億的概率從78%跌至67%。
市場緊張的邏輯并不復(fù)雜:一個中國實驗室在算力受限的條件下,通過架構(gòu)創(chuàng)新把開源模型做到了逼近閉源旗艦的水平,這直接動搖了"前沿AI需要無限算力投入"的核心假設(shè)——而這正是美國科技股過去兩年最大的估值支柱之一。
值得一提的是,上一次一個模型發(fā)布引發(fā)這種級別的全球市場波動,還是DeepSeek R1。
![]()
尾聲
7月27日,K3的完整權(quán)重將正式開源。屆時,全球開發(fā)者將第一次擁有一個參數(shù)規(guī)模和能力水平都逼近閉源旗艦的開源基座模型。如大摩和高盛在研報中所預(yù)判的,這可能只是中國萬億級開源模型密集登場的起點。
K3的中文發(fā)布博客以蘇軾《思治論》開篇:"犯其至難而圖其至遠(yuǎn)者,發(fā)之以勇,守之以專,達(dá)之以強。"去面對最困難的事,追求最遠(yuǎn)大的目標(biāo)。出發(fā)靠勇氣,堅守靠專注,抵達(dá)靠實力。
而官方產(chǎn)品發(fā)布稿的結(jié)尾,月之暗面從容坦然地寫下:K3"在用戶體驗上與Fable 5和GPT-5.6 Sol仍有明顯差距"。
有技術(shù)野心,亦謙虛泰然。這種氣質(zhì),或許同樣值得關(guān)注。
發(fā)之以勇,K3已經(jīng)做到了。守之以專、達(dá)之以強——7月27日開源之后,這個故事會有更多優(yōu)秀中國公司,和Kimi一起寫下去。
*以上內(nèi)容不構(gòu)成投資建議,不代表刊登平臺之觀點,市場有風(fēng)險,投資需謹(jǐn)慎,請獨立判斷和決策。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.