![]()
出品|虎嗅科技組
作者|宋思杭
編輯|苗正卿
頭圖|視覺中國
這是進擊的獨角獸第31篇,該系列關注月之暗面、智譜、MiniMax、階躍星辰、零一萬物、百川智能、面壁智能和DeepSeek共8家大模型獨角獸公司。
梁文鋒的熱度一直在AI圈的Top級,尤其是今年。
從V4預覽版發布,到后來的融資與IPO傳聞,再到一份流傳甚廣的四小時談話實錄,DeepSeek的每一次動作,都能迅速成為行業話題。
7月31日下午,DeepSeek又更新了。
這次,DeepSeek只是在API文檔的更新日志里宣布,V4-Flash正式版API上線公測。
從“正式版”和“公測”兩個詞同時出現來看,這并不是V4的最終形態。DeepSeek也特意強調,本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未發生變化,V4-Pro正式版還要再等等。
但這次更新依然值得關注。
從最新版本來看,V4-Flash-0731沒有改變模型架構和參數規模,只重新進行了一次后訓練。更新后,DeepSeek把幾乎所有篇幅都用來強調它在Agent,尤其是Code Agent上的進步。
這意味著,V4-Flash并不是一次簡單的模型更新。
DeepSeek正在嘗試回答一個新的問題:到了Agent階段,一家公司最需要的,究竟是一個能力最強的模型,還是一個足夠強、足夠快,也足夠便宜的模型?
這一次,DeepSeek沒有繼續堆參數
V4-Flash并不是7月31日才第一次出現。
4月24日,DeepSeek發布V4預覽版時,已經同時推出V4-Pro和V4-Flash。兩者都是MoE模型,但體量差距明顯:V4-Pro擁有1.6萬億總參數,每次推理激活49B參數;V4-Flash擁有284B總參數,每次只激活13B參數。兩款模型均支持100萬Token上下文。
在DeepSeek的定位里,Pro負責能力上限,Flash負責效率。
參數規模更大的V4-Pro,在世界知識以及高難度Agent任務上表現更好;V4-Flash則可以通過增加思考預算,在部分推理任務上接近Pro。換句話說,Flash犧牲了一部分知識容量,卻用更小的激活參數換來了速度和成本。
7月31日的更新沒有改變這套架構。
DeepSeek明確表示,V4-Flash-0731與預覽版的模型結構、尺寸完全一致,僅重新進行了后訓練。
但就是這次后訓練,讓V4-Flash的Agent能力出現了明顯變化。
按照DeepSeek公布的結果,V4-Flash-0731在Terminal Bench 2.1上達到82.7,在NL2Repo上達到54.2,在DeepSWE上達到54.4,在Toolathlon Verified上達到70.3。DeepSeek稱,這些結果已經大幅超過V4-Pro預覽版。
這件事的意義在于,DeepSeek沒有通過增加參數和重新預訓練,來提高模型的Agent能力。
用通俗的話來講就是,DeepSeek雖然繼續在追求AGI,但是并沒有通過一味地增加參數來實現這件事情,而是讓模型學會更好地拆解任務、調用工具、執行代碼,并在更長的任務軌跡中減少錯誤。
過去,大模型公司的主要競爭發生在預訓練階段。誰有更多算力、更多數據,誰就有機會訓練出參數更大、知識更多的模型。但進入Agent階段后,模型能力不再完全由預訓練決定。
一個模型會不會使用終端,能不能在數百次交互中維持任務狀態,遇到錯誤后能否修正,以及是否知道什么時候應該調用什么工具,這些能力越來越依賴后訓練、強化學習和模型外部的執行框架。
V4-Flash的變化,恰好說明了這一點。
這也是為什么,DeepSeek這次除了更新模型,還原生支持了Responses API,并專門適配Codex。同時,DeepSeek在測試Code Agent任務時,使用了尚未正式發布的DeepSeek Harness minimal mode。
換句話說,這些Agent成績不完全屬于模型本身,而是屬于“模型、推理預算與Harness”共同組成的系統。
這當然也意味著,目前公布的數據仍需謹慎看待。
一方面,部分結果來自DeepSeek內部測試集;另一方面,DeepSeek Harness尚未公開,外界還無法在完全相同的環境下復現這些成績。正式版V4-Flash究竟比預覽版進步了多少,還需要等待獨立評測以及真實開發場景驗證。
但至少從這次更新可以看出,DeepSeek正在從只提供模型和API,向Agent所需要的執行環境多走一步。
但DeepSeek目前還沒有親自做一個完整的Agent產品,卻開始提供讓模型進入Agent工作流所必需的接口、適配和Harness。
這是一種非常克制的產品化。
為什么是Flash?
既然V4-Pro的能力上限更高,DeepSeek為什么不先更新Pro?
最直接的原因是,Agent并不是一次模型調用。
在聊天機器人階段,用戶提出一個問題,模型生成一次答案,一次交互就結束了。但在Agent任務里,模型需要先理解目標,再拆解任務、檢索信息、調用工具、讀取結果、修正錯誤,最后完成交付。
一個復雜任務,可能包含幾十次甚至數百次模型調用。
這時,模型單次推理增加的成本和延遲,會在整個任務軌跡中被不斷放大。一個能力更強、但速度更慢、成本更高的模型,未必能帶來更好的實際結果。
Agent真正需要的,往往不是每一步都調用能力最強的模型,而是在絕大多數步驟中,使用一個能力足夠、價格更低、響應更快的模型。
這正是V4-Flash的價值。
根據DeepSeek技術報告,在100萬Token上下文下,V4-Flash單Token推理所需的計算量,約為V3.2的10%,KV Cache則約為V3.2的7%。它的總參數只有V4-Pro的約六分之一,每次激活參數也只有Pro的約四分之一。
這種差距最終也體現在API定價上。
目前,V4-Flash每百萬Token未命中緩存的輸入價格為1元,輸出價格為2元;V4-Pro分別為3元和6元。V4-Flash的并發限制為2500,Pro則為500。Responses API目前也只有V4-Flash支持,V4-Pro預計到8月初才會接入。
在V4的產品體系里,Pro負責證明DeepSeek的模型能力能夠達到什么位置,Flash則負責承擔真正高頻、長鏈條的Agent任務。前者是能力模型,后者更像生產模型。
梁文鋒曾在內部公開說道,“模型應該放在相同成本下比較;在現階段,Coding Agent的優先級高于其他垂直Agent。”
從這個角度來看,V4-Flash此次更新的方向,確實與這兩個判斷形成了呼應。
DeepSeek沒有選擇通過擴大參數,讓Flash在所有能力上追上Pro;它選擇在模型架構不變的情況下,通過后訓練和Agent框架,提高Flash完成真實任務的能力。
這背后是一種更現實的計算。
如果Agent最終要進入企業和開發者的日常工作流,那么決定模型能否被大規模使用的,不只是Benchmark,而是完成一個任務需要多少時間、消耗多少Token,以及最終成功率是多少。
不過,這也是V4-Flash目前最需要證明的地方。
DeepSeek公布的Agent成績大多使用Max reasoning effort完成。更高的思考強度通常意味著更長的推理過程和更多Token消耗。一個模型每百萬Token的價格很低,不等于完成一項任務的總成本一定更低。
如果V4-Flash需要消耗更多Token才能達到接近Pro的效果,那么它在單價上的優勢,可能會被更長的任務軌跡部分抵消。
因此,真正有價值的對比,不是V4-Flash在某一項Benchmark上超過了誰,而是在完成同一個Agent任務時,它與V4-Pro、Kimi、GLM以及閉源模型分別需要多少Token、多少時間和多少次重試。
DeepSeek暫時還沒有給出這個答案。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4879740.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.