![]()
據《財經》獨家報道,DeepSeek已重啟第二輪融資,計劃募資500億元,投前估值約5000億元,預計8月下旬完成簽約。
今年6月,DeepSeek才剛剛完成首輪500億元融資,創下國內大模型首輪融資規模紀錄,投后估值超過3500億元。僅時隔兩個月,其投前估值便攀升約43%,兩輪募資完成后累計金額將超千億元。
估值狂飆的底氣,來自DeepSeek正在改寫行業規則的計費規則。
具體的情況是這樣的,權威模型測試媒體Artificial Analysis放出了一組實測數據,他們用多個主流模型跑同一組基準測試,比誰的平均成本更低。
![]()
測試結果顯示,DeepSeek V4-Flash 跑完整套基準測試,平均一次任務成本只需要3美分。
乍一看這個數據可能沒什么,但是如果把其他主流模型拉來作為對比,一切就都變了。在同一份基準下,Anthropic 的旗艦模型 Claude Fable 5平均成本為3.15美元,GPT-5.6 Sol 要1.86美元,DeepSeek 比 Claude 便宜了100倍。
而且這只是金錢成本,DeepSeek V4-Flash 還有一大特點就是快。根據 Artificial Analysis 的實測數據,DeepSeek V4 Flash(Max Effort 模式)的輸出速度約為113tokens/秒,而同級別的 Anthropic 旗艦模型Claude Opus 5約為74tokens/秒,約為1.5倍。
也就是說,當DeepSeek跑完所有基準測試的時候,Claude才剛跑完一半。
代價是什么呢?
為了得到這種極致的性價比和效率,DeepSeek V4-Flash在智能水平上做了一定的取舍。Artificial Analysis的數據顯示,智能指數方面V4-Flash得分為50分,跟谷歌Gemini 3.6 Flash持平,只落后旗艦模型約10分——Claude Opus 5為61分,Fable 5為60分。
便宜100倍,快2倍,性能只低不到20%。尤其是對于那些需要采購模型 API 的企業來說,這筆賬可能得重新算算了。
A
過去這幾年,大模型行業的定價方式既簡單又粗暴,按跑了多少token算錢。輸入每百萬token多少錢,輸出每百萬token多少錢,廠商怎么定價,用戶就怎么交錢。
但這個算法有個問題,它比的是“原材料價格”,不是“成品價格”。
就像去飯店吃飯,菜單上寫著“大米5塊錢一斤”,但我只在乎“一碗米飯多少錢”。token相當于是大米,任務就是那碗米飯。大米就算再便宜,蒸成米飯的工藝依然會影響米飯的最終價格。
DeepSeek V4-Flash的官方定價是每百萬輸入token 0.14美元,每百萬輸出token 0.28美元,人民幣定價為輸入緩存未命中每百萬輸入1元,輸入緩存命中每百萬0.02元,輸出每百萬2元。
![]()
這個價格本身就已經是行業最低梯隊了。但問題是,token價格低不等于任務成本低,一個模型如果需要生成更多的token才能完成同樣的任務,那便宜的token單價可能換來一張昂貴的賬單。
Artificial Analysis 做的事情,就是把這層“翻譯”給做了。他們比的是“跑完同一套基準測試要花多少錢”。這個口徑叫“每次任務成本”(Cost per Task),它把token用量、推理深度、緩存命中率、思考時間這些變量全部揉在一起,直接給出一個終極答案,干完一件事到底要花多少錢。
但問題來了,DeepSeek憑什么能這么便宜?
V4-Flash模型總參數有2840億,但每次推理時實際激活的只有130億,不到總參數量的5%。
但光靠這些還不夠。V4在注意力機制上做了很大的文章,他們設計了一套叫CSA(壓縮稀疏注意力)和HCA(重度壓縮注意力)交替排列的混合架構。
這兩套機制的核心是不同距離的信息,用不同的精度來記。
比如最近幾分鐘發生的事,記得非常清楚,每一個細節都能說出來;幾天前發生的事,大概就只能記得發生了什么,細節被模糊掉了;幾個月前的事,可能只記得一個大概的印象。
CSA和HCA,就是模擬了這個“近清楚、遠模糊”的記憶規律。隨著上下文增長,把重要的信息留下,不重要的就全都抹去。
在百萬token上下文下,V4 Flash的單token計算量只有V3.2的10%,KV緩存更是只需要7%。而且上下文越長,這個優勢越大。
但架構也還只是故事的一半,V4-Flash從預覽版到正式版進行了一次“原地升級”。
這兩個版本的模型一個參數都沒動,唯一的區別在于后訓練。
這背后是DeepSeek一套獨特的兩階段后訓練方法。
第一階段叫“分科培養”。數學、代碼、Agent、指令跟隨這些領域,各自單獨訓練專家模型。每個專家先用監督微調(SFT)打基礎,再用GRPO強化學習反復打磨。GRPO是郭達雅在DeepSeek時發表論文DeepSeekMath中首次提出的概念。
傳統PPO算法需要額外訓練一個價值函數模型,又費顯存又費算力,而GRPO直接把這一步砍了,改成讓模型對同一問題生成多個答案,用組內的相對排名來代替絕對價值評估,自己跟自己比、自己跟自己學。既省了訓練成本,效果還更好。
第二階段叫“融會貫通”,用On-Policy Distillation(在線策略蒸餾)把多個領域專家的能力合并回同一個模型里。蒸餾的時候不是簡單地復制輸出,而是讓目標模型在自己的策略分布下生成數據,再用專家模型的輸出來矯正,確保合并后的模型不會“學了這個忘了那個”。
過去說模型蒸餾,都是先讓高性能的模型生成答案,再讓低性能的模型去學。但是在線策略蒸餾是反過來的,是學生先自己做題,老師在旁邊看著,邊看邊指導。學生根據各個老師的反饋,當場調整自己的思路,繼續往下做。做完一道,再做下一道,邊做邊學。
“在線”指的是學生和老師是同步的,老師實時給學生反饋。“策略”指的是它學的不是具體某道題的答案,而是“遇到問題該怎么想”這套思考方法。
其結果是,Terminal Bench 2.1從61.8分干到了82.7分。這個測試測的是模型在真實終端環境中完成復雜命令行任務的能力,分數直接超過了自己的老大哥V4-Pro預覽版的72.1分,逼近Anthropic旗艦Opus 4.8的85.0分。
更夸張的是 DeepSWE,這是一個專門測試GitHub真實Issue解決能力的基準,DeepSeek V4-Flash從7.3分飆到54.4分,漲幅645%。一個Flash級別的輕量模型,在9項Agent基準測試上全面碾壓自家旗艦Pro的預覽版。
B
100倍的價差很可能會改變企業對模型API的采購邏輯。
過去幾年,企業選模型的過程就像選供應商,比參數、比跑分、比價格,最后選一個“綜合最優”的。這種思路的前提是模型之間的價格差距不大,都在同一個數量級內,當然大家都會選能力最強的。
但在Artificial Analysis提出“每次任務成本”之后,這個前提就塌了。
假設一個企業每天要處理100萬次API調用,用Claude,每天的成本是31500美元,用DeepSeek,每天只需要300美元。一年下來,差距是1130萬美元。這已經不是省點錢的問題,這是能不能活下去的問題。
尤其是對于那些日常運營包含電商客服、代碼審查、數據清洗場景的企業來說,每天100萬次的API調用非常常見。
所以企業的核心命題就不再是“用哪家模型”了,現在變成了“怎么把任務分到最合適的模型上”。這個思路在行業里有個名字,叫模型路由(Model Routing)。
模型路由的邏輯很簡單,把高價值、高失敗成本的復雜任務放到Claude Opus 5或 GPT-5.6這樣高上限的模型里,比如自動編程中架構設計、金融報告的關鍵分析、法律文書的條款審查等等,企業給模型的智能等級和成功率付費。
不過這些任務數量其實并不多,主要是任務失敗會導致企業付出巨大的代價,用貴模型是完全合理的投資。
像是批量分類、代碼初篩、數據清洗、低風險Agent任務之類的“苦力活”,往往占據了企業運營的80%,因此把這些全都交給DeepSeek,省下來的每一分錢都是純利潤。
根據Menlo Ventures的企業AI調研,37%的企業已經在生產環境中使用5個以上的模型。學術方面也有相同的推論,LMSYS團隊(UC Berkeley、Anyscale)在 ICLR 2025上發表的RouteLLM研究發現,在MT Bench基準上,智能路由可以在保持GPT-4 95%質量的前提下削減85%的成本。
在已經公開的行業實踐中,不同任務分布和路由策略下,降本幅度通常在40%到85%之間。
路由做得好不好,直接決定了企業的AI成本。一個路由策略粗糙的企業,可能80%的任務都打到了旗艦模型上;而一個路由做得精細的企業,可能只有20%的任務需要旗艦模型,其余80%都分流到了高性價比模型。
兩家企業做同樣的事情,AI成本可能差出5到10倍。
最原始的路由,是“靜態規則”。舉個例子,客服部門的,就用便宜模型;算法部門的,就用貴模型。或者關鍵詞匹配,提到“代碼”就用中低檔模型,提到“分析”就用旗艦模型。
這種辦法簡單粗暴,但不準。很多時候會錯配,簡單任務給了貴模型;復雜任務給了便宜模型,做不好還要重來,反而更貴。
高級一點的,是用分類器。先訓練一個小模型,專門用來判斷“這個請求應該用哪個模型”。請求進來,先過分類器,分類器說簡單,就給便宜模型;分類器說難,就給貴模型。
這種辦法比靜態規則準,但還是有問題。分類器本身也會犯錯,而且它只能根據請求的字面意思判斷,不知道模型實際做出來效果怎么樣。
再高級一點的,叫做“先試后升”。不管什么請求,先讓最便宜的模型試試。如果結果質量夠好,就直接用;如果質量不夠,再自動升級到更貴的模型重做。
比如一個任務,直接用Claude要3美元。用DeepSeek先試,3美分,成功了就賺了;失敗了,再用Claude,總共 3.03美元,也只比直接用Claude多花了1%。
只要成功率不是0,這個買賣就劃算。
所以閉源廠商的日子,以后會越來越不好過。它們必須不斷往上走,去做那些更難、更復雜、價值更高的任務,把自己的護城河挖得更深。因為下面的市場,已經被DeepSeek占滿了。
最難受的是中間那檔模型,比DeepSeek強,但又沒強到哪里去,價格還貴了幾十倍的。
往上,打不過旗艦模型的能力;往下,打不過DeepSeek的價格。
這就引起了一個新的現象,DeepSeek斬殺線。
C
Artificial Analysis做了一張圖,把所有主流模型都放在一個坐標系里。橫軸是每次任務的成本,對數坐標;縱軸是智能指數得分。
![]()
圖片中的虛線,代表了DeepSeek V4-Flash正式版的性價比斬殺線,任何處于虛線中的模型,都無法在DeepSeek可以實現的任務中,價格低于DeepSeek。
此前,行業常會用GPT-4o、Claude Sonnet、Gemini Pro這些模型來作為參考,它們的性價比就成為了行業基準。比它們貴的,就得證明自己更強;比它們弱的,就得證明自己更便宜。
不過圖片中可以看到,這些作為行業基準的模型,它們的斬殺線是很低的,稍微推理強度高一點的模型,都可以輕松逃過被斬殺的命運,DeepSeek V4-Flash正式版的出現,讓整個斬殺線抬高到了一個非常高的地方,全球將近70%的模型都處于被斬殺區域。
圖片另一邊的橙黃色區域,是Artificial Analysis基于V4-Flash預覽版和正式版之間的區別,對旗艦模型V4-Pro的正式版性能和價格的預測。
V4-Pro現在的定價,輸入緩存命中是每百萬token1 元人民幣,緩存未命中是12元,輸出是24元。限時優惠期間更便宜,輸入只要2.5元,輸出12元。
雖然價格比Flash貴了不少,但是性能也提升了很大。
這也就意味著,包括低推理強度的Fable 5和GPT-5.6在內,全球90%的模型,在完成任務的性價比這方面,都被DeepSeek斬殺了,更有甚者,無論是把推理強度調高也好調低也好,依然也逃不過被DeepSeek滿血斬殺的命運。
而DeepSeek手里還有另一張牌,Harness。
8月初,DeepSeek Harness負責人崔添翼在X發文稱“如果你是Agent Harness相關開源項目的開發者,希望參加 DeepSeek Harness的內測,可以回復或私信聯系我。請附上GitHub id以及開源代表作。”
雖然有保密協議以防止參與測試者泄露DeepSeek Harness的功能、參數相關信息,但已有部分參與測試者發文稱,“效果炸裂”。
Harness是DeepSeek自研的Agent運行時框架,類似于OpenAI的Codex和Anthropic的Claude Code,但深度綁定了 V4系列的模型能力。
它的作用是讓模型在執行Agent任務時少走彎路、少浪費token。
一個Agent任務的完成質量,不只取決于模型本身的能力,還取決于框架怎么組織上下文、怎么處理工具調用的錯誤返回、什么時候該重新規劃、長會話怎么壓縮、什么條件算任務完成。Harness所負責的,正是這些事情。
在V4-Flash正式版的基準測試中,DeepSeek已經用自家Harness的minimal模式跑了Code Agent任務,max檔位,top_p 0.95,溫度1.0。前文所提到的V4-Flash正式版分數,很多都是DeepSeek Harness跑出來的。
但minimal模式只是Harness能力的冰山一角。Harness正式發布并開放完整功能后,同樣的模型在同樣的任務上,可能會表現出更高的成功率和更少的token浪費。
換句話說,同樣的智能水平,實際成本再降一截。
DeepSeek已經明確表示,Harness會和V4-Pro正式版同步上線。兩層疊加,V4-Pro正式版更強的性能,加上Harness更高效的執行框架,就會有更多的模型面臨斬殺。
因此,Artificial Analysis現在給出的斬殺線可能偏低了。
市場的終局正在收斂成一根“啞鈴”。
一端是少數幾個能力最強的旗艦模型,賣的是極限智能;另一端是DeepSeek,把自己當AI基礎設施來賣。
中間那些既不夠強又不夠便宜的產品,最終會成為這場價格戰中最先被淘汰的犧牲品。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.