出品 | 網(wǎng)易智能
作者 | 辰辰
編輯 | 王鳳枝
"K3很強(qiáng),而且它的能力不能簡(jiǎn)單用'蒸餾
這是OpenAI戰(zhàn)略前瞻負(fù)責(zé)人迪恩·鮑爾(Dean Ball)對(duì)Kimi K3的判斷。
![]()
但在同一篇長(zhǎng)帖中,他隨即談到,美國(guó)政府可以怎樣讓企業(yè)不敢使用中國(guó)開放權(quán)重模型。
"你不需要禁止開源。你只需要指示每個(gè)機(jī)構(gòu),發(fā)布制造恐懼、不確定性和懷疑的軟性法規(guī)。"
他甚至寫道,相關(guān)判斷"不必有特別充分的依據(jù)"。
![]()
兩天前,中國(guó)創(chuàng)業(yè)公司月之暗面剛剛發(fā)布Kimi K3。這款2.8萬億參數(shù)模型登上Arena前端代碼競(jìng)技場(chǎng)榜首,并在Vals AI和Artificial Analysis等第三方榜單中進(jìn)入全球前三。它的整體能力仍落后于Claude Fable 5和GPT-5.6 Sol,但已經(jīng)進(jìn)入全球前沿模型的第一梯隊(duì)。
這意味著,K3參與競(jìng)爭(zhēng)所依靠的已不只是低價(jià)和開放權(quán)重,它開始對(duì)閉源模型的價(jià)格與市場(chǎng)位置形成更直接的壓力。
一、批評(píng)聲迅速擴(kuò)大
鮑爾的長(zhǎng)帖發(fā)布后,討論很快從K3的技術(shù)能力,轉(zhuǎn)向美國(guó)是否會(huì)借監(jiān)管限制中國(guó)開放權(quán)重模型。
最先開火的是戴維·薩克斯(David Sacks)。他曾是特朗普政府首任AI與加密貨幣政策最高負(fù)責(zé)人,現(xiàn)擔(dān)任總統(tǒng)科技顧問委員會(huì)聯(lián)合主席。
"不管他是在描述策略還是在預(yù)測(cè),用制造監(jiān)管不確定性作為競(jìng)爭(zhēng)工具,完全不可接受。"
薩克斯補(bǔ)了一句更重的。"AI模型收入已經(jīng)是閉源雙頭壟斷了。他們希望政府消滅自己的開源競(jìng)爭(zhēng)對(duì)手。"
"他們已經(jīng)把牌攤在桌上了。硅谷剩下的、仍然重視開放競(jìng)爭(zhēng)的那些人,是時(shí)候也把牌攤出來了。"
他說的"雙頭",是OpenAI和Anthropic。
![]()
風(fēng)投人查馬斯·帕利哈皮蒂亞(Chamath Palihapitiya)更直白:"未來是開源的。接受它,往前走。"
![]()
軟件工程師蘇海爾·多希(Suhail Doshi)把話題拉回了原點(diǎn):"美國(guó)AI實(shí)驗(yàn)室的產(chǎn)品是用全人類的數(shù)據(jù)訓(xùn)練出來的,一分錢沒付。任何以'蒸餾'為名叫停開源模型的游說或立法,都是在打擊未來的美國(guó)創(chuàng)新。"
![]()
爭(zhēng)議擴(kuò)大后,鮑爾在當(dāng)晚發(fā)了澄清帖:他說自己是在預(yù)測(cè)政府可能采取的做法,不是在倡議照此執(zhí)行。他個(gè)人支持開源,直到AI變得過于危險(xiǎn)的那一天,他說那將是一個(gè)"悲傷的日子"。
澄清并沒有消除質(zhì)疑。
因?yàn)檎嬲|發(fā)反彈的,不是"建議"還是"預(yù)測(cè)"的區(qū)別,而是他描述那套做法時(shí)使用的措辭。
"不必有特別充分的依據(jù)。"
不管主語是誰,當(dāng)AI行業(yè)內(nèi)部人士公開描述一種無需充分證據(jù)的監(jiān)管策略時(shí),批評(píng)者擔(dān)心的是:規(guī)則可能被刻意模糊,只要最終達(dá)到排斥競(jìng)爭(zhēng)者的效果。
這也正是為什么不少批評(píng)者認(rèn)為,這種思路帶有明顯的"監(jiān)管俘獲"色彩,就是監(jiān)管機(jī)構(gòu)在行業(yè)內(nèi)部人士的建議下,設(shè)計(jì)出有利于既有企業(yè)的規(guī)則。
值得補(bǔ)一句:鮑爾描述的那些工具并非他憑空發(fā)明。Axios的后續(xù)報(bào)道顯示,美國(guó)政府在K3發(fā)布前就已討論過實(shí)體清單、行業(yè)安全警告和模型托管責(zé)任等方案。鮑爾的帖子更像是把既有政策選項(xiàng)公開說透,而不是單獨(dú)發(fā)明了一套新路線。
真正引發(fā)討論的,也正是這套表述本身。
二、第一名,但有代價(jià)
K3到底做了什么,讓一個(gè)OpenAI高管覺得有必要公開討論政府該怎么應(yīng)對(duì)它?
按官方公布的信息:2.8萬億參數(shù),混合專家架構(gòu),896個(gè)專家中每次激活16個(gè),采用自研Delta注意力機(jī)制和注意力殘差架構(gòu)。按月之暗面的說法,新架構(gòu)和訓(xùn)練配方讓K3相對(duì)上一代K2的"整體規(guī)模效率"提高了約2.5倍。
![]()
注意措辭。"規(guī)模效率"不是訓(xùn)練速度,2.5倍是公司口徑。完整技術(shù)報(bào)告將與模型權(quán)重一同發(fā)布。
關(guān)鍵的時(shí)間節(jié)點(diǎn)在這里:月之暗面承諾在7月27日前發(fā)布完整權(quán)重。截至7月21日,官方權(quán)重尚未發(fā)布,用戶還不能通過正式渠道自行下載部署。即使權(quán)重開放,2.8萬億參數(shù)模型的本地部署也需要極高的硬件條件。
在第三方評(píng)測(cè)中,K3的前端代碼能力排到了Arena榜單第一,綜合能力在Vals AI指數(shù)38個(gè)模型中排第2,Artificial Analysis在7月17日發(fā)布的快照中將其列為第3。這些榜單各有側(cè)重,題型、采樣和排名更新時(shí)間不同,不能合并成"全面追平"的結(jié)論。但一家中國(guó)創(chuàng)業(yè)公司在多個(gè)維度進(jìn)入第一梯隊(duì),本身就是一個(gè)信號(hào)。
然后來看短板。
K3的token消耗很大。一位開發(fā)者讓模型畫一只騎自行車的鵜鶘,95個(gè)輸入token換來16658個(gè)輸出token,其中13241個(gè)是思考 token。"這只鵜鶘花了我25美分。"
它的運(yùn)行成本不低。Arena聯(lián)合創(chuàng)始人評(píng)估,K3的推理成本與 Anthropic的 Claude Sonnet系列相當(dāng),顯著低于 Fable 5,但遠(yuǎn)高于此前的中國(guó)開源模型。由于托管服務(wù)需求接近算力上限,月之暗面一度暫停了 K3的新訂閱,API仍然可用。
一位署名 Jukan的 Citrini Research分析師在 X上寫道:中國(guó)公司可能缺乏足夠算力服務(wù)全部推理需求,但它們不是在虧本銷售,也沒有無法收回訓(xùn)練成本。暫停訂閱不等于傾銷,它恰恰說明需求超過了供給能力。
![]()
這些短板并不意味著"K3不夠好",反而讓一個(gè)問題變得更突出:在這樣的資源約束下,月之暗面是怎么做到的?
三、去過北京辦公室的美國(guó)人
內(nèi)森·蘭伯特(Nathan Lambert)去過月之暗面的北京辦公室。
他是艾倫人工智能研究所的前高級(jí)研究科學(xué)家,運(yùn)營(yíng)著 AI通訊 Interconnects。K3發(fā)布后,他寫了一篇萬字長(zhǎng)文。
![]()
有一段話被反復(fù)引用。
"我去中國(guó)參訪時(shí)見到了 Kimi 的核心團(tuán)隊(duì)。他們的文化中有一種你在走進(jìn)辦公室的瞬間就能感受到的東西,有人稱之為氣場(chǎng),以及一種表達(dá)這種氣場(chǎng)的自由。我去過很多 AI 公司,很少有一家能讓你立刻感受到這種特質(zhì)。"
他還記下了一個(gè)細(xì)節(jié)。當(dāng)他隨口說,OpenAI 一個(gè)普通研究員可能調(diào)用幾千塊 H100級(jí)別 GPU 時(shí),Kimi 的研究員露出了驚訝的表情。
蘭伯特的結(jié)論是:中國(guó)實(shí)驗(yàn)室的資本效率遠(yuǎn)高于美國(guó)同行。 "在一個(gè)按規(guī)模法則運(yùn)行的世界里,智能與有效資本成正比,而資本購(gòu)買算力、數(shù)據(jù)和人才,這可能是你的 AI 產(chǎn)業(yè)能擁有的最大優(yōu)勢(shì)。"
但他也謹(jǐn)慎地加了限定。中國(guó)研究人員薪酬更低、推理需求此前相對(duì)有限、訓(xùn)練算力分配方式不同,這些都可能是效率優(yōu)勢(shì)的部分解釋。但他強(qiáng)調(diào),這些因素都很難精確測(cè)量,不能據(jù)此推算 K3的完整訓(xùn)練資源。
"許多結(jié)果是可能的,"他寫道,"K3應(yīng)該提高大多數(shù)人對(duì)'中國(guó)可能在近期直接領(lǐng)先 AI 能力'這一概率的估計(jì),即便它不是你的最可能結(jié)果。"
他說的不是"中國(guó)已經(jīng)贏了"。
他說的是:別再假設(shè)美國(guó)一定會(huì)贏。
四、一個(gè)減速,一個(gè)加速
鮑爾的長(zhǎng)帖里有一個(gè)判斷值得認(rèn)真對(duì)待。
"開放權(quán)重模型在經(jīng)濟(jì)意義上是天生減速主義的,它壓低前沿模型的利潤(rùn)空間,減少可再投資的資本,從而減緩下一代最強(qiáng)模型的研發(fā)速度。"
如果衡量的是閉源實(shí)驗(yàn)室繼續(xù)投入巨額資本、推動(dòng)模型能力前沿的速度,這個(gè)判斷有一定道理。但它只說了一半。
蘭伯特在自己的文章里拆開了這個(gè)判斷:開放權(quán)重模型對(duì)前沿實(shí)驗(yàn)室的經(jīng)濟(jì)回報(bào)是減速的,但對(duì) AI 在經(jīng)濟(jì)中的擴(kuò)散是加速的,它降低了獲取一定水平智能的門檻,讓幾乎任何企業(yè)都能用開源模型定制領(lǐng)域?qū)S玫闹悄荏w。
"一個(gè)減速,一個(gè)加速。"蘭伯特寫道。取決于你站在誰的立場(chǎng)上。
因此,當(dāng)鮑爾說"開源是減速主義"時(shí),如果只衡量閉源頭部實(shí)驗(yàn)室繼續(xù)加碼資本投入的速度,這個(gè)判斷并非全無根據(jù)。但在批評(píng)者看來,鮑爾的問題在于,他容易把"對(duì)頭部閉源實(shí)驗(yàn)室的資本投入不利",進(jìn)一步推演成"對(duì)整個(gè) AI 發(fā)展不利",而這一步推演,恰恰是爭(zhēng)議的焦點(diǎn)。
有人視之為蓄意。有人視之為視角局限。不管是哪一種,薩克斯的回應(yīng)替更多人說了話:"他們已經(jīng)把牌攤在桌上了。"
蘭伯特在萬字長(zhǎng)文中把這個(gè)問題往前推了一步。
鮑爾說開源是減速主義,它壓低前沿實(shí)驗(yàn)室的利潤(rùn)空間,減少可再投資的資本,減緩下一代最強(qiáng)模型的研發(fā)。蘭伯特承認(rèn)這個(gè)邏輯鏈條在經(jīng)濟(jì)學(xué)上成立。但他追問了一句:然后呢?
減速,就一定不好嗎?
他的核心觀點(diǎn)是:開放權(quán)重模型略微滯后于閉源前沿,K3追到了3到5個(gè)月,這個(gè)時(shí)間差本身是有價(jià)值的。它為社會(huì)爭(zhēng)取到了一個(gè)天然的觀察窗口:在新能力被廣泛擴(kuò)散之前,先看清楚它到底是什么、能做什么、邊界在哪里。
![]()
"如果開放權(quán)重模型落后前沿3個(gè)月、6個(gè)月或9個(gè)月,那仍然是一個(gè)非常短的時(shí)間窗口。我們真正需要做的不是試圖消滅這個(gè)窗口,開放模型終將跨越所有關(guān)鍵能力門檻,不管合不合法,而是在窗口期內(nèi)建立評(píng)估和應(yīng)對(duì)真正風(fēng)險(xiǎn)的能力。"
換句話說,與其一味封堵,更重要的是盡快建立評(píng)估體系。
這也是鮑爾與薩克斯?fàn)幷摰慕稽c(diǎn)。鮑爾強(qiáng)調(diào)的是,開放模型與前沿能力的差距縮短后,風(fēng)險(xiǎn)評(píng)估窗口正在收窄;薩克斯擔(dān)心的則是,站在"墻內(nèi)"的公司會(huì)借安全之名抬高競(jìng)爭(zhēng)門檻。蘭伯特提供了第三種思路:圍墻能否守住不是唯一問題,更重要的是在開放模型跨過關(guān)鍵能力門檻前,建立起相應(yīng)的評(píng)估和應(yīng)對(duì)機(jī)制。
五、修圍墻的人
比爾·格利(Bill Gurley)在《華盛頓郵報(bào)》上寫了一篇評(píng)論。他是硅谷最著名的風(fēng)險(xiǎn)投資家之一,P3研究所的創(chuàng)始人。
![]()
他的論點(diǎn)很簡(jiǎn)單:開源是一種商業(yè)策略,經(jīng)濟(jì)學(xué)家邁克爾·波特(Michael Porter)稱之為"成本領(lǐng)先",在軟件行業(yè)有三十年的成功記錄。
Red Hat 用免費(fèi)軟件建起了一家公司。2019年,它以340億美元賣給了 IBM。
谷歌免費(fèi)送出了 Android 和 Kubernetes。沒有收費(fèi),沒有限制。
微軟曾稱開源為"癌癥"。如今它擁有 GitHub。
"那些現(xiàn)在把開源模型稱為危險(xiǎn)的人,"格利寫道,"自己的公司每天都在依賴開源代碼運(yùn)行。"
然后他提了一個(gè)更尖銳的問題。
如果這些 AI 公司真的像他們自己說的那樣,增長(zhǎng)最快、利潤(rùn)最高、模型遙遙領(lǐng)先,那為什么還需要政府幫忙擋住競(jìng)爭(zhēng)對(duì)手?
一家正在跑贏未來的公司,不需要華盛頓來絆倒追趕者。
這不是在說安全擔(dān)憂是假的。Transformer 編輯沙基爾·哈希姆(Shakeel Hashim)的評(píng)估是:K3"很可能不具備危險(xiǎn)的網(wǎng)絡(luò)攻擊能力"。蘭伯特在萬字長(zhǎng)文的結(jié)論部分也坦率寫道:當(dāng)模型變得足夠強(qiáng)時(shí),開源的風(fēng)險(xiǎn)將是真實(shí)的。"問題不在于今天的風(fēng)險(xiǎn)是否被夸大,而在于當(dāng)真正的風(fēng)險(xiǎn)出現(xiàn)時(shí),我們是否已經(jīng)建立了評(píng)估和應(yīng)對(duì)的能力。"
安全是真實(shí)的。商業(yè)也是真實(shí)的。
真正值得追問的,不是"這是安全還是商業(yè)",而是當(dāng)缺乏具體能力評(píng)估的安全警告可以直接變成市場(chǎng)準(zhǔn)入工具時(shí),那堵墻在替誰加固優(yōu)勢(shì)。
鮑爾說,他不是在建議,而是在預(yù)測(cè)。但不論主語是什么,行業(yè)內(nèi)部人士把"不必有特別充分的依據(jù)"納入可行的政策描述,本身已經(jīng)足以引發(fā)質(zhì)疑。
那道圍墻最直接保護(hù)的,往往就是已經(jīng)站在墻內(nèi)的既有公司。
