日前,DeepSeek 發(fā)布了推理系統(tǒng) DSpark。
這是一套面向大語(yǔ)言模型在線推理場(chǎng)景的系統(tǒng)級(jí)優(yōu)化方案,目標(biāo)是在不改變模型能力和輸出結(jié)果的前提下,大幅提升推理效率,緩解 GPU 利用率不足、推理延遲高以及高并發(fā)吞吐受限等行業(yè)長(zhǎng)期難題。
官方數(shù)據(jù)顯示,DSpark 已部署到 DeepSeek V4 的生產(chǎn)環(huán)境,單用戶生成速度可提升 60%~85%,高并發(fā)場(chǎng)景下系統(tǒng)吞吐最高可提升約 4 倍。
![]()
DSpark 發(fā)布后,迅速在全球 AI 社區(qū)引發(fā)了強(qiáng)烈關(guān)注,成為當(dāng)下大模型推理優(yōu)化領(lǐng)域討論度最高的技術(shù)方案之一。
這其中,最具行業(yè)權(quán)威性、最貼合底層落地邏輯的解讀,來(lái)自 PyTorch 核心維護(hù)者、Fireworks AI 聯(lián)合創(chuàng)始人 Dmytro Dzhulgakov。
他公開(kāi)評(píng)價(jià)稱,“DSpark 巧妙地融合了多種 Speculative Decoding(投機(jī)解碼)思想,在真實(shí)生產(chǎn)環(huán)境中實(shí)現(xiàn)了 1.5~5 倍的吞吐提升”,并通過(guò)十條連續(xù)推文,從底層原理、技術(shù)取舍、工程落地、行業(yè)價(jià)值四個(gè)維度,完成了對(duì) DSpark 最全面、最透徹的拆解。
![]()
在他看來(lái),DSpark 最值得關(guān)注的并不是提出了一項(xiàng)全新的算法,而是把過(guò)去幾年分散出現(xiàn)的多項(xiàng)推理優(yōu)化技術(shù),真正整合成了一套能夠穩(wěn)定運(yùn)行在生產(chǎn)環(huán)境中的工業(yè)級(jí)系統(tǒng),這也是其區(qū)別于眾多實(shí)驗(yàn)室級(jí)優(yōu)化方案的核心優(yōu)勢(shì)。
![]()
理解 DSpark 的顛覆性價(jià)值,首先要厘清大模型推理行業(yè)長(zhǎng)久以來(lái)的核心痛點(diǎn)。 為什么如今硬件算力飛速迭代,但大語(yǔ)言模型推理仍然普遍存在延遲高、算力浪費(fèi)的問(wèn)題?
核心原因從來(lái)不是 GPU 算力不足,而是 Transformer 架構(gòu)與生俱來(lái)的自回歸生成機(jī)制。
模型訓(xùn)練階段可以實(shí)現(xiàn)海量數(shù)據(jù)的大規(guī)模并行計(jì)算,算力利用率極高,但推理階段必須遵循嚴(yán)格的串行邏輯:每輸出一個(gè) Token,都必須等待前一個(gè) Token 計(jì)算、校驗(yàn)完成后,才能啟動(dòng)下一輪計(jì)算。
這種“逐字等待”的生成模式,導(dǎo)致 GPU 大部分時(shí)間處于閑置等待狀態(tài),海量算力被白白浪費(fèi),這也是大模型線上推理成本居高不下的根本癥結(jié)。
為了解決算力閑置問(wèn)題,行業(yè)最早的優(yōu)化思路是批處理(Batch)調(diào)度,將不同用戶的請(qǐng)求整合為一個(gè)批次交由 GPU 統(tǒng)一處理,以此提升整體吞吐量。
但這種方式存在無(wú)法調(diào)和的矛盾:批次越大,單用戶請(qǐng)求排隊(duì)等待的延遲就越高,嚴(yán)重影響用戶體驗(yàn);批次越小,GPU 越容易空閑,算力利用率依舊偏低。
這種優(yōu)化僅僅是在吞吐量和延遲之間做被動(dòng)取舍,始終沒(méi)有打破“逐 Token 串行生成”的底層限制,無(wú)法從根本上解決推理效率問(wèn)題。
真正重構(gòu)大模型推理邏輯、突破串行瓶頸的,是近幾年快速普及的 Speculative Decoding(投機(jī)解碼)技術(shù),這也是 DSpark 整套方案的核心底層。
投機(jī)解碼的核心邏輯可以通俗概括為“先猜、再驗(yàn)”,徹底顛覆傳統(tǒng)自回歸的串行模式:不再讓超大體量的主模型逐一生成 Token,而是通過(guò)輕量化草稿模型,一次性預(yù)判生成未來(lái)多個(gè)候選 Token,再交由主模型進(jìn)行一次性批量校驗(yàn)。
![]()
如果草稿預(yù)測(cè)內(nèi)容準(zhǔn)確,即可直接保留多段 Token,一次完成多步推理;如果出現(xiàn)預(yù)測(cè)錯(cuò)誤,則從第一個(gè)錯(cuò)誤節(jié)點(diǎn)重啟生成。這種模式大幅減少了主模型的計(jì)算次數(shù),從根源上提升推理速度、盤(pán)活 GPU 算力。
但 Dmytro 在解讀中明確點(diǎn)出,傳統(tǒng)投機(jī)解碼方案落地后,很快陷入了新的技術(shù)瓶頸,各類主流路線都存在明顯短板。
早期投機(jī)解碼方案需要單獨(dú)訓(xùn)練專屬小型草稿模型,雖然能夠?qū)崿F(xiàn)基礎(chǔ)加速效果,但極大增加了企業(yè)的模型訓(xùn)練、部署運(yùn)維、版本迭代成本,工程落地門檻極高。
后續(xù)行業(yè)迭代出 EAGLE、MTP 等主流優(yōu)化方案,摒棄了獨(dú)立小模型的模式,直接讓主模型自主學(xué)習(xí)多 Token 預(yù)測(cè)能力,實(shí)現(xiàn)了草稿生成與主模型的能力統(tǒng)一,大幅降低了工程復(fù)雜度,這也是 DSpark 沿用的核心基礎(chǔ)思路。
![]()
即便解決了草稿模型依賴的問(wèn)題,新的瓶頸依舊存在。
Dmytro 分析,EAGLE3 這類串行草稿方案,雖然生成的草稿連貫性強(qiáng)、準(zhǔn)確率穩(wěn)定,但草稿生成本身仍是串行邏輯,無(wú)法拉長(zhǎng)預(yù)測(cè)片段,速度提升上限有限。
而 DFlash 這類純并行草稿方案,雖然生成速度極快,但所有 Token 獨(dú)立預(yù)測(cè)、缺少上下文時(shí)序關(guān)聯(lián),序列越靠后的位置,預(yù)測(cè)出錯(cuò)概率越高,Token 接受率大幅衰減,大量無(wú)效預(yù)測(cè)反而消耗額外算力,出現(xiàn)“加速不增吞吐”的問(wèn)題,速度和準(zhǔn)確率始終無(wú)法兼顧。
![]()
針對(duì)這一行業(yè)共性難題,DSpark 創(chuàng)新性引入半并行草稿生成(Semi-parallel Drafting)架構(gòu),也是 Dmytro 重點(diǎn)解讀的核心亮點(diǎn)之一。
不同于傳統(tǒng)純串行、純并行的兩極化設(shè)計(jì),半自回歸架構(gòu)在兩種方案之間找到了最優(yōu)平衡點(diǎn),主體采用并行生成框架保障速度,同時(shí)搭配輕量化時(shí)序模塊補(bǔ)充上下文依賴信息。
DSpark 提供了 Markov 頭和 RNN 頭兩種可選的順序依賴模塊,兩種模塊算力開(kāi)銷極低,不會(huì)增加草稿生成的耗時(shí),卻能持續(xù)傳遞前文語(yǔ)義信息,有效抑制序列尾部 Token 的出錯(cuò)衰減問(wèn)題,僅用兩層網(wǎng)絡(luò)結(jié)構(gòu),就能實(shí)現(xiàn)傳統(tǒng)五層并行模型的準(zhǔn)確率效果,完美解決了并行草稿不準(zhǔn)、串行草稿不快的行業(yè)痛點(diǎn)。
![]()
![]()
同時(shí),兩種模塊可根據(jù)模型類型、業(yè)務(wù)場(chǎng)景自由適配,兼容性極強(qiáng),能夠快速適配各類主流開(kāi)源大模型。
在解決了草稿生成的速度與精度矛盾后,DSpark 更進(jìn)一步補(bǔ)齊了傳統(tǒng)投機(jī)解碼的調(diào)度短板,這也是 Dmytro 認(rèn)為該方案適配生產(chǎn)環(huán)境的關(guān)鍵設(shè)計(jì)。
所有投機(jī)解碼都存在一個(gè)天然缺陷:預(yù)測(cè)長(zhǎng)度越遠(yuǎn),出錯(cuò)概率越高,盲目拉長(zhǎng)草稿序列,會(huì)導(dǎo)致大量驗(yàn)證失敗,前期算力投入全部浪費(fèi)。
針對(duì)這個(gè)問(wèn)題,DSpark 加入了實(shí)時(shí)置信度預(yù)測(cè)機(jī)制,徹底告別傳統(tǒng)固定草稿長(zhǎng)度的粗放模式。
![]()
系統(tǒng)會(huì)對(duì)每一個(gè)生成的候選 Token 進(jìn)行實(shí)時(shí)置信度打分,精準(zhǔn)預(yù)判內(nèi)容通過(guò)主模型校驗(yàn)的概率,一旦檢測(cè)到預(yù)測(cè)置信度持續(xù)下降,會(huì)主動(dòng)終止草稿生成,提前進(jìn)入驗(yàn)證環(huán)節(jié),避免無(wú)效算力消耗;若預(yù)測(cè)狀態(tài)穩(wěn)定、置信度達(dá)標(biāo),則持續(xù)向后擴(kuò)展草稿序列,最大化單次推理的Token產(chǎn)出效率。
與之匹配的,是 DSpark 動(dòng)態(tài)自適應(yīng)的驗(yàn)證調(diào)度策略,這也是區(qū)別于傳統(tǒng)方案的核心升級(jí)。
過(guò)往所有投機(jī)解碼方案,均采用固定長(zhǎng)度驗(yàn)證模式,無(wú)論輸入文本難度高低、預(yù)測(cè)準(zhǔn)確率如何,都使用統(tǒng)一的驗(yàn)證窗口。
Dmytro 指出,這種“一刀切”的調(diào)度方式,是高并發(fā)場(chǎng)景吞吐難以提升的核心原因:業(yè)務(wù)低負(fù)載時(shí),固定短窗口浪費(fèi)算力;業(yè)務(wù)高并發(fā)、預(yù)測(cè)難度大時(shí),固定長(zhǎng)窗口會(huì)導(dǎo)致大量驗(yàn)證失敗,擠占有效算力,最終得不償失。
而 DSpark 實(shí)現(xiàn)了硬件感知+準(zhǔn)確率雙動(dòng)態(tài)調(diào)度,構(gòu)建了完整的閉環(huán)推理體系。
系統(tǒng)會(huì)實(shí)時(shí)監(jiān)測(cè) GPU 負(fù)載、批量任務(wù)規(guī)模、草稿接受率三大核心指標(biāo),動(dòng)態(tài)調(diào)整驗(yàn)證窗口長(zhǎng)度:預(yù)測(cè)準(zhǔn)確率高、GPU 負(fù)載低時(shí),主動(dòng)拉長(zhǎng)驗(yàn)證序列,降低單用戶推理延遲;預(yù)測(cè)偏差大、并發(fā)壓力高時(shí),自動(dòng)縮短驗(yàn)證窗口,減少無(wú)效計(jì)算,保障整體系統(tǒng)吞吐量穩(wěn)定。
![]()
這種自適應(yīng)調(diào)度機(jī)制,讓整套方案能夠適配線上復(fù)雜多變的真實(shí)業(yè)務(wù)場(chǎng)景,而非僅適配實(shí)驗(yàn)室理想數(shù)據(jù)。
Dmytro 在十條解讀中反復(fù)強(qiáng)調(diào),DSpark 最大的價(jià)值,從來(lái)不是單點(diǎn)算法創(chuàng)新,而是極致的系統(tǒng)工程整合能力,這也是整篇技術(shù)方案最值得行業(yè)借鑒的核心。
過(guò)去幾年,半自回歸生成、多 Token 預(yù)測(cè)、置信度篩選、動(dòng)態(tài)驗(yàn)證、硬件感知調(diào)度等技術(shù)點(diǎn)早已被行業(yè)陸續(xù)提出,但這些技術(shù)始終是零散的“獨(dú)立零件”,大多只停留在論文和實(shí)驗(yàn)階段,存在兼容性差、調(diào)度沖突、額外延遲高等落地問(wèn)題,幾乎沒(méi)有方案能夠?qū)崿F(xiàn)無(wú)縫融合。
而 DSpark 完成了前所未有的系統(tǒng)化整合,將所有分散的優(yōu)化技術(shù),串聯(lián)成一套端到端、可落地、零冗余的完整工作流。
同時(shí)通過(guò)異步調(diào)度設(shè)計(jì),兼容 CUDA 圖回放等主流硬件加速手段,讓所有動(dòng)態(tài)調(diào)度、智能篩選的新增邏輯,幾乎不產(chǎn)生額外延遲,徹底解決了多數(shù)優(yōu)化方案“算法好看、落地拉胯”的通病。
在真實(shí)生產(chǎn)環(huán)境中,兼顧了離線實(shí)驗(yàn)指標(biāo)、線上穩(wěn)定性、硬件利用率和用戶體驗(yàn),是一套真正工業(yè)化、標(biāo)準(zhǔn)化的推理優(yōu)化體系。
在 Dmytro 看來(lái),DSpark 的出現(xiàn),也徹底指明了大模型推理行業(yè)的未來(lái)競(jìng)爭(zhēng)方向。
過(guò)去行業(yè)比拼的是“創(chuàng)新性算法設(shè)計(jì)”,依靠單一新穎算法就能實(shí)現(xiàn)指標(biāo)突破;但當(dāng)下大模型推理優(yōu)化已經(jīng)進(jìn)入深水區(qū),單一算法的優(yōu)化空間基本見(jiàn)頂,純串行、純并行的傳統(tǒng)技術(shù)路線很難再有顛覆性突破。
未來(lái)行業(yè)的核心競(jìng)爭(zhēng)力,將是算法、系統(tǒng)工程、硬件調(diào)度的深度協(xié)同,誰(shuí)能將現(xiàn)有成熟技術(shù)極致整合、適配真實(shí)生產(chǎn)場(chǎng)景、實(shí)現(xiàn)降本增效,誰(shuí)就能占據(jù)技術(shù)優(yōu)勢(shì)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.