有國(guó)外博主在研究了 DeepSeek v4 和 Kimi k2 技術(shù)文檔后,發(fā)現(xiàn)前者 使用了 Muon 優(yōu)化器,并結(jié)合 Kimi 的配方來(lái)擴(kuò)展其用于 LLM 訓(xùn)練。
同時(shí),Kimi K2(及K2.6)又采用了 DeepSeek-V3 的架構(gòu)技術(shù)(超稀疏 MoE + MLA)。
![]()
他感慨稱,“開(kāi)源 AI 實(shí)驗(yàn)室正在相互疊加彼此的研究成果,這正是它應(yīng)該的樣子”。
對(duì)此,美國(guó)某AI公司聯(lián)合創(chuàng)始人轉(zhuǎn)評(píng)稱,這就是中國(guó)的模式,值得稱贊。
同時(shí),他吐槽之前倡導(dǎo)公益起家的 OpenAI ,及谷歌都公布技術(shù)論文,而現(xiàn)在全部走向閉源,紛紛把自己變成了“黑盒”公司,讓人失望。
![]()
確實(shí)如他所言,中國(guó) AI 公司大都在走開(kāi)源方向,一方面在全球 AI 生態(tài)中影響力越來(lái)越大,更重要的是,國(guó)內(nèi) AI 大模型公司間協(xié)同發(fā)展的趨勢(shì)也開(kāi)始形成。
這里的“協(xié)同”并不是公司層面的合作,而是開(kāi)發(fā)者在實(shí)際使用中形成的分工——通過(guò)像 Dify、n8n 這樣的編排工具,把不同模型嵌入同一流程。
比如 Kimi 系列長(zhǎng)上下文能力較強(qiáng), DeepSeek 代碼、數(shù)學(xué)推理等結(jié)構(gòu)化任務(wù)上投入更多,二者并不沖突,反而天然適合在工作流中組合使用。
一個(gè)負(fù)責(zé)長(zhǎng)文本理解與信息整合,一個(gè)負(fù)責(zé)精確執(zhí)行與生成。
這種現(xiàn)象背后,是國(guó)內(nèi) AI 生態(tài)一個(gè)非常現(xiàn)實(shí)的結(jié)構(gòu):基礎(chǔ)設(shè)施、模型能力和應(yīng)用層之間高度耦合。
云廠商如阿里巴巴、字節(jié)同時(shí)提供算力與模型服務(wù);主流模型如DeepSeek 等直接開(kāi)放權(quán)重或技術(shù)細(xì)節(jié),讓導(dǎo)致架構(gòu)(MoE)、訓(xùn)練技巧快速擴(kuò)散;創(chuàng)業(yè)公司在這些基礎(chǔ)上構(gòu)建差異化能力,而開(kāi)源社區(qū)進(jìn)一步放大技術(shù)擴(kuò)散。
結(jié)果就是,MoE等架構(gòu)設(shè)計(jì)、訓(xùn)練方法(如指令微調(diào)、對(duì)齊流程)和工程優(yōu)化,會(huì)形成快速傳播。
如MiniMax abab 系列公開(kāi)提到 MoE 架構(gòu),長(zhǎng)文本能力頁(yè)成為國(guó)內(nèi) AI 大模型的“標(biāo)配競(jìng)爭(zhēng)項(xiàng)”,大家開(kāi)始優(yōu)化 attention 機(jī)制,而不是單純堆參數(shù)。
當(dāng)然,這種協(xié)同主要還是在模型架構(gòu)、推理優(yōu)化方法等可見(jiàn)層,而不是在數(shù)據(jù)構(gòu)成與對(duì)齊策略等底層。
相比而言,美國(guó)則是另一番景象。
以 OpenAI 和 Anthropic 為例,兩者在模型設(shè)計(jì)理念與安全策略上存在明顯分歧,且分別綁定不同的云與資本體系(微軟、Google、Amazon)。
這種結(jié)構(gòu)導(dǎo)致技術(shù)路線更趨向封閉:關(guān)鍵方法不公開(kāi),數(shù)據(jù)體系不共享,模型能力通過(guò) API 形成壁壘。
競(jìng)爭(zhēng)的核心則在于“誰(shuí)能構(gòu)建更強(qiáng)的獨(dú)立體系”,寡頭間競(jìng)爭(zhēng),而不是“體系之間如何協(xié)同”。
![]()
這種協(xié)同性,更極致的一個(gè)表現(xiàn)就是華為與 DeepSeek v4的芯模協(xié)同優(yōu)化。
DeepSeek v4 也是全球首個(gè)在官方技術(shù)報(bào)告中,將華為昇騰NPU與英偉達(dá)GPU并列寫(xiě)入硬件驗(yàn)證清單的世界級(jí)開(kāi)源大模型。
![]()
報(bào)告明確指出,“我們?cè)谟ミ_(dá)GPU和華為昇騰NPU兩個(gè)平臺(tái)上均驗(yàn)證了細(xì)粒度專(zhuān)家并行(EP)方案”,標(biāo)志著模型從設(shè)計(jì)階段就納入了國(guó)產(chǎn)算力的適配目標(biāo)。
這意味著,二者完成了從底層算子到上層模型的深度適配,實(shí)現(xiàn)了DeepSeek-V4在華為昇騰平臺(tái)上從訓(xùn)練到推理的全棧部署,而不僅依賴英偉達(dá)硬件。
在這個(gè)層面上,模型公司與芯片公司的關(guān)系更接近“共同完成一個(gè)系統(tǒng)工程”,是 “共研”特征的協(xié)同。
造成這種差異的根本原因,更多應(yīng)該源于各自面臨的系統(tǒng)條件。
美國(guó)擁有相對(duì)充足且成熟的算力與資本體系,使單一公司可以支撐完整閉環(huán),更容易走向封閉競(jìng)爭(zhēng)。
相比之下,中國(guó)的算力供給、芯片生態(tài)與應(yīng)用市場(chǎng)之間存在更強(qiáng)的相互依賴關(guān)系,任何一環(huán)都很難完全獨(dú)立運(yùn)作,這就自然推動(dòng)了跨主體的協(xié)同。
中國(guó) AI 的“協(xié)同生態(tài)”,可能不是一個(gè)理想化的選擇,而是一種工程上的必然結(jié)果,從而也就形成了一個(gè)更像“系統(tǒng)工程”的發(fā)展路徑。
在這樣的體系里,技術(shù)進(jìn)步往往不是某一家公司的單點(diǎn)突破,而是多個(gè)環(huán)節(jié)同時(shí)推進(jìn)的結(jié)果,包括接下來(lái)在市場(chǎng)應(yīng)用端能反催生出來(lái)的無(wú)限可能。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.