vLLM 又搞大動作了,月初剛發了0.24,我詳細分析過:
今天 v0.25 正式版發布了
![]()
老規矩,本文就所有更新,挑重點給大家分享一下
先來一張全景圖,一眼看懂這次更新的核心模塊:
![]()
vLLM v0.25 核心更新全景圖 新模型支持一覽
這版新支持的模型架構不少:
模型
MiMo-V2.5
小米最新視覺-語言模型
Laguna XS.2
新架構,支持 DFlash
Moondream3
輕量多模態,支持 query 和 caption
Qianfan-OCR
百度千帆 OCR 模型
Cohere MoE
Cohere 的 MoE 架構
DeepSeek V4
新增 AMD/ROCm 支持 + 流水線并行
Qwen3.5
Mamba 混合架構,Model Runner V2 支持
特別提一下DeepSeek V4 現在可以跑在 AMD 卡上了,對于不想被 NVIDIA 綁架的同學來說是個好消息
多硬件平臺擴展
vLLM 現在的硬件覆蓋面越來越廣:
AMD ROCm 7.2.2— DBO 動態批優化、Fused Allreduce+RMSNorm、Fused Shared Expert
CPU— FP8 attention for AMX/AVX-512,FP8 W8A16 linear/MoE,RISC-V 支持
Intel XPU— top-k/top-p 采樣、out-of-place all-reduce、LoRA
IBM Power— VSX 注意力后端
從 NVIDIA 到 AMD 到 Intel 到 IBM,甚至還有 RISC-V,vLLM 這是要做推理引擎界的"全平臺通吃選手"
推測解碼支持 Thinking Budget
這個特性非常關鍵,很多人可能忽略了
現在 DeepSeek-R1、Qwen3 這類推理模型在生成時有個"思考預算"(thinking budget),之前用推測解碼會和這個機制沖突,導致生成結果不正確
v0.25 修復了這個問題,推測解碼現在可以正確感知 reasoning token 的邊界了,意思是:推理模型也能享受推測解碼的加速,這在之前是不行的
此外還新增了:
Gemma4 的 MTP(Multi-Token Prediction)推測解碼
MiMo-V2.5 的 MTP 支持
Mistral 的 EAGLE 推測解碼
Cohere Eagle 推測解碼
推測解碼陣營越來越壯大了
性能優化:一堆實打實的提升
這版的性能優化點非常多,挑幾個有代表性的:
FlashInfer top-k/top-p 采樣器默認開啟— 采樣速度更快
AllPool.forward 快了 51%— Embedding 模型直接受益
GPU?CPU 同步消除— 減少不必要的等待
numpy 零拷貝 embedding 序列化— Embedding API 響應更快
FlashInfer FP8 異步 TP 融合— 張量并行場景加速
allreduce + RMS 融合重新啟用— DP/PP 場景受益
Docker 鏡像縮小 2.5GB— 通過延遲下載 FlashInfer cubin 實現
性能這塊 vLLM 是真舍得下功夫,每個版本都能看到十幾項針對性的 kernel 優化
KV Cache 卸載 + HMA 混合內存分配器
這是面向大規模部署的重磅功能
KV Cache 卸載(把不活躍的 KV 緩存從 GPU 卸載到 CPU)之前就有了,這次 v0.25 把它和HMA(Hybrid Memory Allocator,混合內存分配器)完全打通了:
調度器側滑動窗口分組支持
MooncakeStoreConnector 支持分布式 KV 卸載
DCP/PCP 協議支持
你可以用更少的 GPU 顯存服務更多的并發請求,同時保持較高的吞吐量,對于那些 context window 很長的場景(比如 128K 上下文的模型),這個功能非常有價值
量化支持更新
NVFP4— KV Cache 支持、ModelOpt NVFP4 W4A16、all-gather GEMM 融合
MXFP4— Humming MXFP4 MoE 后端
TurboQuant— 混合模型和統一量化支持
NVFP4 在這個版本獲得了大量支持,如果你用的是 Hopper 或 Blackwell 卡,4-bit 量化的性能和精度平衡會更好
API 改進
Responses API支持流式 tool calling(
required和命名工具選擇)OpenAI 兼容性增強:
system_fingerprint字段、prompt_embeds、渲染后的 prompt 文本XGrammar 0.2.0— 結構化 tags 支持嚴格的 tool calling + reasoning
新增 Fastokens tokenizer 支持
RLHF 顯式 weight update API
官方當前 Quickstart 給出的基礎環境是 Linux 與 Python 3.10 到 3.13,NVIDIA CUDA 用戶推薦用uv管理環境
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
如果你是 Docker 用戶,鏡像小了 2.5GB,拉取速度會明顯快一些
總結
如果你在生產環境跑 LLM 推理服務,vLLM 依然是我的首選推薦,這個項目的迭代速度和社區活躍度都是頂級的,每個版本都能看到實質性的進步
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.