日前,知名科技分析師 GDP發表了篇長文,題目是《DeepSeek 的10 萬億美元宏大戰略》,在 X 上引發很大關注,被認為是對 DeepSeek 最深刻的分析。
![]()
以下為原文:
你是否曾好奇,DeepSeek會以怎樣的方式賺取巨額利潤?
該企業并未像GLM、MoonShot、MiniMax等團隊一樣,推出具備競爭力的代碼生成相關產品,也沒有研發多模態、音頻、視頻類模型。時至今日,其配套部署框架仍未成型,近期才開始招聘相關人員搭建框架。
長期來看,DeepSeek始終堅持開源路線,毫不吝嗇地分享自身核心技術。這一切舉動看起來像是莽撞行事?或是無端耗費資金?計劃向其注資百億美元的投資者,難道是在白白揮霍錢財?
在我看來,事實恰恰相反。
下文將梳理DeepSeek過往發展舉措,剖析其奉行的發展戰略。
DeepSeek創始人梁文峰著眼于更為宏大的目標,企業自身有望達成萬億美元估值,同時還將助力打造出規模達十萬億美元的產業市場。
![]()
回顧DeepSeek的崛起之路
當下行業普遍選擇循序漸進優化模型、快速落地應用產品,代碼類產品便是主流方向,而DeepSeek始終逆勢而行。
我在 2025 年 1 月 27 日發過一條爆火推文,把 DeepSeek 的發展稱為“英雄之旅(Hero’s Journey)”。
而如今,這個故事變得更加有趣了。
當別人還在構建 Dense Model(稠密模型)時,DeepSeek 去做了訓練難度極高的 MoE(Mixture of Experts,混合專家模型)。
他們采用“第一性原理”方法,發明了新的 GRPO 算法,用來替代 RL 中主流但昂貴的 PPO 算法。
他們提出 RLVR(Reinforcement Learning from Verified Rewards,基于可驗證獎勵的強化學習),把它作為提升模型推理能力的關鍵策略。
他們提出了通過 “Multi Token Prediction” 實現 Speculative Decoding(推測解碼)的簡單策略,同時強化了訓練信號。
他們完善了 “ZERO bubble” pipeline,以提升有限 GPU 資源的利用率。
他們發布了 Expert Load Balancer,使所有人都更容易部署 MoE 模型。尤其是 “Wide Expert Parallel” 策略,可以通過更大的 batch 極大降低推理成本。
他們發明了 MLA、DSA、CSA、HCA,用于減少 KV Cache 需求,并讓上下文增長時的計算需求接近恒定。
他們發明了 Engram,用內存換算力。
他們發明了 mHC,實現模型規模增長時的穩定訓練。
還有更多……
在“英雄之旅”這種經典敘事結構里,英雄一開始并不知道自己的最終使命是什么。
他會在旅途中不斷學習,并逐漸發現自己真正的偉大使命。一路上,他會遇到大量質疑者、惡意攻擊者;他自身也存在缺陷與短板;他會遭遇看似無法克服的挑戰;但最終,他會學會如何建立聯盟、如何高效利用有限資源,并最終完成使命。
正因為如此,觀眾才會為英雄加油。
![]()
這也是 DeepSeek 能夠贏得全球粉絲、尊敬,以及爭議的原因。
而接下來我會詳細說明:DeepSeek 走到今天,似乎已經發現了他們真正的終極目標:不是賣編程訂閱服務,而是打造一個價值 10 萬億美元的中國 AI 硬件生態系統,并讓自身達到 1 萬億美元估值。
與此同時,他們也會推動西方硬件生態出現更多新進入者。
歡迎各界評論探討
先來做一點 KV Cache 的有趣計算
看看 @SemiAnalysis_ 最近這條非常及時的推文:
![]()
DeepSeek 已經比任何人都更好地解決了這個問題。
我們先做一點有趣的 KV Cache 數學計算。即使你不喜歡數學也沒關系。我們使用最近發布的 KV Cache 計算器,來看看 DeepSeek V4 Pro 相比最新的 GLM 和 Qwen 模型,在 KV Cache 上節省了多少。
計算條件:
100 萬 context
KV 精度:8-bit
indexer 精度:16-bit
你也可以自己玩這個計算器:
https://kvcache.ai/tools/kv-cache-calculator/
![]()
在 100 萬上下文長度下:
DeepSeek V4 只需要 5.48GB HBM
GLM5 需要 60GB HBM
Qwen3-235B-A22B 更夸張,需要 89GB
注意:
DeepSeek 是 1.6T 參數模型
GLM5 大約 700B 參數,已經使用了 DeepSeek 的 MLA 與 DSA,但還沒使用最新壓縮 attention
Qwen3-235B-A22B 大約 235B 參數,使用的是 GQA attention
DeepSeek 在降低內存壓力方面做出了基礎性貢獻。
如果這些創新被廣泛采用,它將使長時任務 Agent 的成本變得極低,并解鎖下一代應用場景。
![]()
“瘋狂”背后的邏輯
KV Cache 之所以能做到如此小,而且不犧牲質量,是因為:
他們因此能夠以極低價格提供長時間緩存服務——價格不到 Sonnet 4.6 Cache Hit 的 3%,并且緩存可保留數小時。
對于長時任務而言,小 KV Cache 可以非常高效地卸載到 SSD,再重新加載。
這大幅降低了對 HBM 的需求。
而 HBM 恰恰是中國 AI 硬件產業中最短缺、最難制造的內存。
DeepSeek 還在 Dual Path 論文中提出了更快從 SSD 加載 KV Cache 的技術。
![]()
KV Cache 壓縮的直接受益者是誰?
誰能大量供應 SSD?
別忘了,YMTC 正在崛起為 3D NAND 巨頭。
NAND 讓 DeepSeek 可以避免重復計算 KV。
反過來,DeepSeek 又為 NAND 與 SSD 創造了巨大的市場——不僅是 YMTC,而是整個產業。
![]()
不只是 NAND 與 SSD
LPDDR 也有巨大潛力。
它可以用來存儲模型權重,并在需要時“即時流式傳輸”到 HBM,從而降低 HBM 壓力。
SGLang 團隊已經發表過相關博客。
雖然 DeepSeek 沒有專門為此設計,但他們的 MoE 架構、大量 Experts,以及 4-bit 權重,使這種方案非常容易實現。
![]()
這種創新,再加上超高壓縮率的 KV Cache(且幾乎無損),會顯著降低 HBM 需求。
中國誰在做 LPDDR?
CXMT。
![]()
他們在 LPDDR 速度上只落后半代,在密度上只落后一代。
并不遠。
再加上中國未來會擁有大量 NAND 與 LPDDR,這是否能緩解算力壓力?
答案是:可以。
更聰明地利用內存,也能降低 GPU/ASIC 壓力
NAND 用于 KV Cache 的價值很明顯:
可以更長時間保留 KV Cache
降低 HBM 壓力
避免重復計算 KV
緩解 GPU 與 ASIC 的算力壓力
那么 LPDDR 是否也能發揮類似作用?
答案仍然是:可以。
LPDDR 還可以存儲一種叫做 “Engram” 的結構。
在 Engram 論文中,DeepSeek 指出:
雖然 MoE 通過條件計算擴展模型容量,但 Transformer 缺乏原生的知識檢索機制。
因此,它們只能通過計算來低效地模擬“檢索”。
于是他們提出了 Engram:
一種基于 O(1) 哈希查找的現代化 N-gram embedding 模塊。
他們稱之為 “conditional memory(條件記憶)”。
這種方式節省了大量計算,但需要大量內存來存儲 embedding table。
本質上,這是經典的“內存換算力”。
關鍵洞察在于:
LPDDR 的內存讀取成本,遠遠低于完整 Transformer forward pass 的計算成本。
因此,在大規模系統中,這種交換極其劃算。
![]()
這些取舍非常值得
中國 GPU 與 ASIC 在原始 FLOPs 上,長期都可能落后于西方 GPU。
原因包括:
沒有 EUV
晶體管密度不足
封裝技術落后
因此,“用更多內存換更少計算”這種路線,非常值得。
尤其是在中國能夠大量生產 NAND 與 LPDDR 的情況下。
DeepSeek 的長期布局
從所有這些創新來看:
DeepSeek 的目標,似乎并不是賺取幾億美元的短期利潤。
否則,他們完全可以:
做多模態
做語音
做視頻
但他們沒有。
他們在玩的是一個耐心的“10 萬億美元游戲”:
打造替代性的 AI 硬件生態。
這不僅僅是讓中國內存廠商成為 AI 硬件關鍵玩家。
更重要的是:
他們正在從根本上降低 AI 對資源的需求。
這樣一來:
更多 GPU/ASIC 廠商會變得可行
更多網絡芯片廠商會變得可行
西方開源生態也會受益
新硬件創業公司也會受益
所有的跡象都表明了這一點。讓我們來詳細重溫一下他們提出的所有創新:
1.在DeepSeek V2中引入了混合專家模型(MoE)和MLA。
MoE使得以減少40%到50%計算量的方式訓練極具智慧的模型成為可能。MLA使得將KV Cache減少90%成為可能。這使得將KV Cache卸載到SSD變得非常高效。
這些想法是在他們2024年5月的DeepSeek V2論文中引入的。它隨后解鎖了DeepSeek V3的訓練,這在當時幾乎相當于閉源水平,而他們當時僅僅使用了2048張被閹割的H800 GPU。
![]()
2 .DSA(在DeepSeek V3.2 Exp中引入)用以減少長上下文場景下的計算量,并緩解HBM帶寬的壓力。
它確保了計算量不會隨著上下文的增長而暴漲。
請看下面的圖表——DeepSeek-v3.2的處理時間在不同上下文長度下保持平穩。
![]()
3. mHC于2025年12月在論文《mHC: Manifold-Constrained Hyper-Connections》中引入。
mHC是DeepSeek的一項宏觀架構創新,它重新發明了信息在Transformer層之間流動的方式。
自ResNet以來,行業一直使用標準的殘差連接(x + F(x)),而mHC將殘差流擴展為多條平行的信息高速公路,并允許在它們之間進行學習型的混合。
但至關重要的是,它將混合矩陣約束為雙隨機矩陣(通過Sinkhorn-Knopp投影到Birkhoff多胞形上),這在數學上保證了信號幅度在任意深度下都能得以保持。
這解決了此前困擾無約束Hyper-Connections(最初由ByteDance發明)的災難性不穩定問題——在無約束情況下,信號放大在27B規模下暴增了3000倍,導致訓練徹底崩潰。
其計算成本微乎其微:mHC僅增加了6.7%的實際訓練耗時,因為它沒有改變注意力層或FFN層的FLOPs,只是改變了它們的輸出在層與層之間的路由方式。
然而,其性能提升卻是巨大的:在27B參數規模下,mHC在BIG-Bench Hard推理上提升了+7.2分,在DROP上提升了+3.2分,在GSM8K數學上提升了+2.8分,在MMLU通用知識上提升了+1.4分,而這一切都是在相同的模型大小和幾乎相同的計算預算下實現的。
從本質上講,mHC通過為網絡提供更豐富、更具表現力的跨層信息路由拓撲結構,在幾乎不增加額外FLOPs成本的情況下,實現了顯著更高的“單參數智能”。
![]()
mHC是一個復雜的架構;但它提供了極高的訓練穩定性和更高的單參數智能。
1 . CSA和HSA(于2026年4月在DeepSeek V4中引入)通過壓縮KV Token,將KV需求進一步降低了90%,并大幅減少了所需的FLOPs,從而同時緩解了HBM和GPU/ASIC的壓力。
![]()
2 . Engram于2026年第一季度引入,他們在某種程度上用內存(LPDDR內存)換取了計算。
如下面的詳細圖表所示,在相同的總參數預算下,Engram帶來了顯著的性能提升。
![]()
3 . 極端專注于計算與通信的重疊,以及像Dual Path這樣的創新,可以被解釋為應對資源限制的權宜之計。
但DeepSeek走得更遠,他們甚至在ASIC設計上為硬件廠商提供建議,以確保他們不會浪費寶貴的硅片資源。
這出自DeepSeek V4的論文。
![]()
這是他們在DeepSeek V4論文中分享的建議。可以肯定的是,他們在私底下分享的反饋要多得多。
4 . 對TileLang的投入指向了同一個始終如一的方向:他們不僅是在解決自己的算力荒,更是在讓中國的硬件生態系統具備與西方生態系統競爭的能力。
有了TileLang,只需開發一次算子內核(用于計算的代碼),就可以在多個已提供TileLang后端的硬件平臺上成功運行。
我預計中國其他所有的實驗室也會加入進來——間接幫助中國硬件廠商應對“CUDA護城河”。這也解鎖了更多西方硬件(如AMD)的可能性。
注意:中國的許多AI平臺要么提供CUDA兼容性,要么提供CUDA轉換層:Moore Threads、MetaX、Biren和Iluvatar CoreX是通過轉換層實現CUDA兼容度最高的中國芯片。他們(在理論上)不需要TileLang。
![]()
大規模強化學習(RL)與RSI
通過獲取更多的算力(得益于更多潛在的硬件選擇)以及計算需求的降低,DeepSeek可以承擔更具雄心的訓練項目,尤其是RL后訓練(post training)。
RL涉及生成大量的軌跡(trajectories)——生成數萬億的Token。這會很快變得非常昂貴。
此外,為了訓練1M上下文的模型,你需要生成那么長的軌跡。為如此長的軌跡訓練模型,才能夠解鎖長文本任務。
此外,由于選擇增加,DeepSeek可以獲得更多硬件,這將使自動化研究(RSI)成為可能。
RSI涉及AI自身來設計和開展實驗。這種方法包含大量的試錯,成本會迅速飆升。
然而,RSI對于探索整個設計空間至關重要。DeepSeek在邁向AGI以及隨后的ASI之前,需要具備RSI的能力。
DeepSeek今天所做的,就是整個行業明天要做的:
DeepSeek圍繞混合專家模型(MoE)、MLA、DSA的創新,已經被來自全球和中國其余的AI實驗室所采納。
例如,ZAI(GLM系列模型的創造者)使用了MLA和DSA。Kimi(Moonshot)采用了MLA,并且毫不避諱地表示他們的架構是基于DeepSeek的架構。
作為回報,DeepSeek使用了最早由Kimi(Moonshot)用于大規模訓練的Muon優化器。
(注:MoE于2017年在Google被發明,Noam Shazeer是關鍵作者。DeepSeek將其應用到了極大的規模并發明了自己的獨門絕技。 Muon(由Newton-Schulz正交化的動量)
優化器由機器學習研究員Keller Jordan于2024年底創建。Kimi(Moonshot)團隊是第一個將其投入大規模應用的人。)
那么如何賺錢呢?
讓我們來研究一下OpenAI這個有趣的例子。
OpenAI獲得了根據算力消耗里程碑以低價購買AMD和Cerebras股票的認股權證/期權。這對AMD和Cerebras來說是一筆偉大的交易。有了OpenAI對他們的綁定,使他們更有可能在長期內取得成功。
引自AMD的公告:“作為協議的一部分,為了進一步對齊戰略利益,AMD已向OpenAI發行了高達1.6億股AMD普通股的認股權證,結構設計為隨著特定里程碑的達成而分批行權。第一批隨著初始1吉瓦(GW)的部署而行權,其余批次隨著采購規模擴大到6吉瓦而逐步行權。行權進一步與AMD達到特定的股價目標,以及OpenAI達成使AMD能夠規模化部署所需的技術和商業里程碑相掛鉤。”
![]()
我預測DeepSeek將與多家中國的內存、ASIC、CPU和網絡棧廠商達成此類協議,并與他們緊密合作,以確保他們的硬件棧能夠勝任頂尖的AI工作負載。
鑒于西方(包括東亞盟友)所有AI股票的總市值遠遠超過10T USD。這種“通過授予股權進行協作”的方法,讓DeepSeek能夠幫助在中國創造一個同樣巨大的產業,并在自己實現1T USD估值的同時,分得屬于自己的一塊蛋糕。
這將使他們能夠賺到多得多的錢,同時也能實現他們用自己的話所說的“讓AGI惠及每個人”的目標。
Liang Wenfeng——Jim Simons的崇拜者——是一位極其聰明的資本家,絕對不會錯過這一點!
如果你回顧一下DeepSeek迄今為止所做的一切,這是唯一說得通的邏輯……
![]()
這些是關鍵的AI股票。未顯示的還有超大規模云廠商(Hyper-scalars)及其他許多公司。
關于這些創新的詳細博客將于本周末發布,如果感興趣請關注我的Substack
https://polymath707.substack.com/ ...
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.