![]()
出品|虎嗅科技組
作者|宋思杭
編輯|苗正卿
頭圖|視覺中國
這是進(jìn)擊的獨(dú)角獸第31篇,該系列關(guān)注月之暗面、智譜、MiniMax、階躍星辰、零一萬物、百川智能、面壁智能和DeepSeek共8家大模型獨(dú)角獸公司。
梁文鋒的熱度一直在AI圈的Top級(jí),尤其是今年。
從V4預(yù)覽版發(fā)布,到后來的融資與IPO傳聞,再到一份流傳甚廣的四小時(shí)談話實(shí)錄,DeepSeek的每一次動(dòng)作,都能迅速成為行業(yè)話題。
7月31日下午,DeepSeek又更新了。
這次,DeepSeek只是在API文檔的更新日志里宣布,V4-Flash正式版API上線公測。
從“正式版”和“公測”兩個(gè)詞同時(shí)出現(xiàn)來看,這并不是V4的最終形態(tài)。DeepSeek也特意強(qiáng)調(diào),本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未發(fā)生變化,V4-Pro正式版還要再等等。
但這次更新依然值得關(guān)注。
從最新版本來看,V4-Flash-0731沒有改變模型架構(gòu)和參數(shù)規(guī)模,只重新進(jìn)行了一次后訓(xùn)練。更新后,DeepSeek把幾乎所有篇幅都用來強(qiáng)調(diào)它在Agent,尤其是Code Agent上的進(jìn)步。
這意味著,V4-Flash并不是一次簡單的模型更新。
DeepSeek正在嘗試回答一個(gè)新的問題:到了Agent階段,一家公司最需要的,究竟是一個(gè)能力最強(qiáng)的模型,還是一個(gè)足夠強(qiáng)、足夠快,也足夠便宜的模型?
這一次,DeepSeek沒有繼續(xù)堆參數(shù)
V4-Flash并不是7月31日才第一次出現(xiàn)。
4月24日,DeepSeek發(fā)布V4預(yù)覽版時(shí),已經(jīng)同時(shí)推出V4-Pro和V4-Flash。兩者都是MoE模型,但體量差距明顯:V4-Pro擁有1.6萬億總參數(shù),每次推理激活49B參數(shù);V4-Flash擁有284B總參數(shù),每次只激活13B參數(shù)。兩款模型均支持100萬Token上下文。
在DeepSeek的定位里,Pro負(fù)責(zé)能力上限,F(xiàn)lash負(fù)責(zé)效率。
參數(shù)規(guī)模更大的V4-Pro,在世界知識(shí)以及高難度Agent任務(wù)上表現(xiàn)更好;V4-Flash則可以通過增加思考預(yù)算,在部分推理任務(wù)上接近Pro。換句話說,F(xiàn)lash犧牲了一部分知識(shí)容量,卻用更小的激活參數(shù)換來了速度和成本。
7月31日的更新沒有改變這套架構(gòu)。
DeepSeek明確表示,V4-Flash-0731與預(yù)覽版的模型結(jié)構(gòu)、尺寸完全一致,僅重新進(jìn)行了后訓(xùn)練。
但就是這次后訓(xùn)練,讓V4-Flash的Agent能力出現(xiàn)了明顯變化。
按照DeepSeek公布的結(jié)果,V4-Flash-0731在Terminal Bench 2.1上達(dá)到82.7,在NL2Repo上達(dá)到54.2,在DeepSWE上達(dá)到54.4,在Toolathlon Verified上達(dá)到70.3。DeepSeek稱,這些結(jié)果已經(jīng)大幅超過V4-Pro預(yù)覽版。
這件事的意義在于,DeepSeek沒有通過增加參數(shù)和重新預(yù)訓(xùn)練,來提高模型的Agent能力。
用通俗的話來講就是,DeepSeek雖然繼續(xù)在追求AGI,但是并沒有通過一味地增加參數(shù)來實(shí)現(xiàn)這件事情,而是讓模型學(xué)會(huì)更好地拆解任務(wù)、調(diào)用工具、執(zhí)行代碼,并在更長的任務(wù)軌跡中減少錯(cuò)誤。
過去,大模型公司的主要競爭發(fā)生在預(yù)訓(xùn)練階段。誰有更多算力、更多數(shù)據(jù),誰就有機(jī)會(huì)訓(xùn)練出參數(shù)更大、知識(shí)更多的模型。但進(jìn)入Agent階段后,模型能力不再完全由預(yù)訓(xùn)練決定。
一個(gè)模型會(huì)不會(huì)使用終端,能不能在數(shù)百次交互中維持任務(wù)狀態(tài),遇到錯(cuò)誤后能否修正,以及是否知道什么時(shí)候應(yīng)該調(diào)用什么工具,這些能力越來越依賴后訓(xùn)練、強(qiáng)化學(xué)習(xí)和模型外部的執(zhí)行框架。
V4-Flash的變化,恰好說明了這一點(diǎn)。
這也是為什么,DeepSeek這次除了更新模型,還原生支持了Responses API,并專門適配Codex。同時(shí),DeepSeek在測試Code Agent任務(wù)時(shí),使用了尚未正式發(fā)布的DeepSeek Harness minimal mode。
換句話說,這些Agent成績不完全屬于模型本身,而是屬于“模型、推理預(yù)算與Harness”共同組成的系統(tǒng)。
這當(dāng)然也意味著,目前公布的數(shù)據(jù)仍需謹(jǐn)慎看待。
一方面,部分結(jié)果來自DeepSeek內(nèi)部測試集;另一方面,DeepSeek Harness尚未公開,外界還無法在完全相同的環(huán)境下復(fù)現(xiàn)這些成績。正式版V4-Flash究竟比預(yù)覽版進(jìn)步了多少,還需要等待獨(dú)立評(píng)測以及真實(shí)開發(fā)場景驗(yàn)證。
但至少從這次更新可以看出,DeepSeek正在從只提供模型和API,向Agent所需要的執(zhí)行環(huán)境多走一步。
但DeepSeek目前還沒有親自做一個(gè)完整的Agent產(chǎn)品,卻開始提供讓模型進(jìn)入Agent工作流所必需的接口、適配和Harness。
這是一種非常克制的產(chǎn)品化。
為什么是Flash?
既然V4-Pro的能力上限更高,DeepSeek為什么不先更新Pro?
最直接的原因是,Agent并不是一次模型調(diào)用。
在聊天機(jī)器人階段,用戶提出一個(gè)問題,模型生成一次答案,一次交互就結(jié)束了。但在Agent任務(wù)里,模型需要先理解目標(biāo),再拆解任務(wù)、檢索信息、調(diào)用工具、讀取結(jié)果、修正錯(cuò)誤,最后完成交付。
一個(gè)復(fù)雜任務(wù),可能包含幾十次甚至數(shù)百次模型調(diào)用。
這時(shí),模型單次推理增加的成本和延遲,會(huì)在整個(gè)任務(wù)軌跡中被不斷放大。一個(gè)能力更強(qiáng)、但速度更慢、成本更高的模型,未必能帶來更好的實(shí)際結(jié)果。
Agent真正需要的,往往不是每一步都調(diào)用能力最強(qiáng)的模型,而是在絕大多數(shù)步驟中,使用一個(gè)能力足夠、價(jià)格更低、響應(yīng)更快的模型。
這正是V4-Flash的價(jià)值。
根據(jù)DeepSeek技術(shù)報(bào)告,在100萬Token上下文下,V4-Flash單Token推理所需的計(jì)算量,約為V3.2的10%,KV Cache則約為V3.2的7%。它的總參數(shù)只有V4-Pro的約六分之一,每次激活參數(shù)也只有Pro的約四分之一。
這種差距最終也體現(xiàn)在API定價(jià)上。
目前,V4-Flash每百萬Token未命中緩存的輸入價(jià)格為1元,輸出價(jià)格為2元;V4-Pro分別為3元和6元。V4-Flash的并發(fā)限制為2500,Pro則為500。Responses API目前也只有V4-Flash支持,V4-Pro預(yù)計(jì)到8月初才會(huì)接入。
在V4的產(chǎn)品體系里,Pro負(fù)責(zé)證明DeepSeek的模型能力能夠達(dá)到什么位置,F(xiàn)lash則負(fù)責(zé)承擔(dān)真正高頻、長鏈條的Agent任務(wù)。前者是能力模型,后者更像生產(chǎn)模型。
梁文鋒曾在內(nèi)部公開說道,“模型應(yīng)該放在相同成本下比較;在現(xiàn)階段,Coding Agent的優(yōu)先級(jí)高于其他垂直Agent。”
從這個(gè)角度來看,V4-Flash此次更新的方向,確實(shí)與這兩個(gè)判斷形成了呼應(yīng)。
DeepSeek沒有選擇通過擴(kuò)大參數(shù),讓Flash在所有能力上追上Pro;它選擇在模型架構(gòu)不變的情況下,通過后訓(xùn)練和Agent框架,提高Flash完成真實(shí)任務(wù)的能力。
這背后是一種更現(xiàn)實(shí)的計(jì)算。
如果Agent最終要進(jìn)入企業(yè)和開發(fā)者的日常工作流,那么決定模型能否被大規(guī)模使用的,不只是Benchmark,而是完成一個(gè)任務(wù)需要多少時(shí)間、消耗多少Token,以及最終成功率是多少。
不過,這也是V4-Flash目前最需要證明的地方。
DeepSeek公布的Agent成績大多使用Max reasoning effort完成。更高的思考強(qiáng)度通常意味著更長的推理過程和更多Token消耗。一個(gè)模型每百萬Token的價(jià)格很低,不等于完成一項(xiàng)任務(wù)的總成本一定更低。
如果V4-Flash需要消耗更多Token才能達(dá)到接近Pro的效果,那么它在單價(jià)上的優(yōu)勢,可能會(huì)被更長的任務(wù)軌跡部分抵消。
因此,真正有價(jià)值的對(duì)比,不是V4-Flash在某一項(xiàng)Benchmark上超過了誰,而是在完成同一個(gè)Agent任務(wù)時(shí),它與V4-Pro、Kimi、GLM以及閉源模型分別需要多少Token、多少時(shí)間和多少次重試。
DeepSeek暫時(shí)還沒有給出這個(gè)答案。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4879740.html?f=wyxwapp
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.