大家好,我是 Ai 學習的老章
NVFP4一直是英偉達專屬,前幾天我也剛介紹:
沒想到大模型量化巨星 Unsloth 比英偉達還會玩,他們發布了全新的 Dynamic NVFP4 量化技術,直接讓本地跑 Qwen3.6 的速度翻了 2.5 倍,而且精度幾乎無損,就問你猛不猛吧
![]()
先說結論
如果你手上有一張 RTX 5090 或者 B200 這樣的 Blackwell 架構 GPU,那這次的 NVFP4 量化絕對值得關注:
Qwen3.6-27B:跑在 24GB VRAM 里,速度比標準 NVFP4 快 2.5 倍
Qwen3.6-35B-A3B:高并發下在 B200 上飆到17,561 tokens/s
精度呢?MMLU-Pro、GPQA、AIME 2025 全線對齊 BF16 水平
附贈FP8 KV Cache 校準,上下文長度直接翻倍
一句話總結:又快又準,還省顯存
![]()
Qwen3.6 NVFP4 吞吐量對比 Qwen3.6 速覽
先快速回顧一下 Qwen3.6 本身——這是阿里 4 月份發布的新一代混合思維多模態模型家族,包含兩個版本:
模型
參數量
特點
Qwen3.6-27B
270 億(Dense)
旗艦級編碼能力,SWE-bench Verified 77.2
Qwen3.6-35B-A3B
350 億總參/30 億激活(MoE)
每 token 只激活 3B 參數,推理效率極高
關鍵能力:
256K 原生上下文,YaRN 可擴展到 100 萬
201 種語言支持
Agentic Coding:前端工作流和倉庫級推理表現優異
Thinking Preservation:保留歷史思維鏈,多輪對話更連貫
多模態:支持圖片、視頻理解
Qwen3.6-27B 在 SWE-bench Verified 上拿到 77.2 分,Terminal-Bench 2.0 上 59.3 分——這是跟 Claude 4.5 Opus 同檔的成績,就這么說吧,27B 的密集模型做到這個水平,確實離譜
![]()
Qwen3.6-27B 官方 Benchmark Dynamic NVFP4 到底做了什么
這是整篇文章的重頭戲,先解釋一下為什么 Unsloth 的 NVFP4 比 NVIDIA 官方的 NVFP4 快這么多
核心差異:W4A4 vs W4A16
NVIDIA 官方的 NVFP4 量化方案是W4A16——權重是 4-bit,但激活值(Activation)仍然是 16-bit,這意味著矩陣乘法時,GPU 需要把 4-bit 權重先反量化到 16-bit,再做計算
Unsloth 的方案是W4A4——權重和激活值都壓到 4-bit,直接利用 Blackwell 架構的FP4 Tensor Core做原生計算,少了反量化這一步,吞吐量直接起飛
下面這張圖一目了然地展示了兩種方案的核心區別:
![]()
W4A4 vs W4A16 對比 動態層量化
"Dynamic" 不是隨便起的名字,Unsloth 不是把所有層一刀切量到 4-bit,而是:
重要層保留更高精度——對模型輸出影響大的層會被上采樣
校準數據集精選——混合 Unsloth 自有數據集 + UltraChat,專門針對編程、工具調用、對話三個場景優化
Chat Template 改進——修復了編碼和工具調用的一致性問題,減少循環和其他已知問題
這就是為什么精度能保住——不是暴力壓縮,而是"該省省、該花花"
內置 MTP 加速
MTP(Multi-Token Prediction)是 Qwen3.6 的獨門武器,可以一次預測多個 token,Unsloth 這次把 MTP 張量直接內置到 NVFP4 量化模型里,相當于開箱即用,不需要額外加載 MTP 模塊
FP8 KV Cache 校準
另一個實用改進:通過 FP8 KV Cache 校準,上下文長度可以翻倍,對于 Agent 場景來說,更長的上下文意味著可以記住更多的對話歷史和工具調用結果
性能跑分:說數據 吞吐量對比(1×B200,128 并發)
Unsloth 官方在 B200 上做了完整測試:
Qwen3.6-27B NVFP4:比 NVIDIA 官方 NVFP4 快2.5 倍
Qwen3.6-35B-A3B NVFP4:1.56 倍提速(精準版)
Qwen3.6-35B-A3B NVFP4-Fast:1.79 倍提速(全 W4A4 版本)
高并發場景下,35B-A3B 可以飆到17,561 tokens/s
解碼速度(Decode Speed)方面:27B 提升 1.03 倍,35B-A3B 提升 1.17~1.22 倍
精度對比:幾乎無損
這是最讓人放心的部分——量化后精度跟 BF16 基本持平:
Qwen3.6-27B NVFP4 精度 Benchmark:
Provider
MMLU-Pro
GPQA
AIME 2025
Unsloth NVFP4
NVIDIA NVFP4
FP8
BF16
Qwen3.6-35B-A3B NVFP4 精度 Benchmark:
Provider
MMLU-Pro
GPQA
AIME 2025
Unsloth NVFP4
Unsloth Fast
NVIDIA NVFP4
FP8
BF16
Unsloth 還特別檢查了輸出長度——NVFP4 量化后的模型并沒有"思考更久"來彌補精度,所以加速是實打實的,不是靠多想來湊的
兩個 35B-A3B 版本的選擇
Unsloth 給 35B-A3B 出了兩個版本:
版本
特點
加速比
NVFP4
部分層保留高精度,更準確
1.56x
NVFP4-Fast
全 W4A4,最大速度
1.79x
如果你跑 Agent 或者工具調用場景,建議用標準版;如果純聊天或者對速度更敏感,Fast 版本更合適
硬件要求
這是最關鍵的限制——NVFP4 需要 Blackwell 架構 GPU:
? RTX 50 系列(5090、5080 等)
? DGX Spark
? B200 / B300
? RTX 40 系列及更早的卡不支持
如果你的 GPU 不是 Blackwell 架構,別急——Unsloth 的 Dynamic GGUF 量化同樣優秀,配合 MTP 在舊卡上也能跑出不錯的速度:
Qwen3.6
3-bit
4-bit
6-bit
8-bit
BF16
27B
15 GB
18 GB
24 GB
30 GB
55 GB
35B-A3B
17 GB
23 GB
30 GB
38 GB
70 GB
怎么跑起來 方案一:vLLM(推薦)
方案二:SGLang# 安裝 vLLM
uv venv myenv --python 3.12
uv pip install --python myenv/bin/python \
"vllm==0.24.0" "nvidia-cutlass-dsl==4.5.2" --torch-backend=auto
# 啟動 27B NVFP4
vllm serve unsloth/Qwen3.6-27B-NVFP4 \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'# 或者 35B-A3B Fast 版本
vllm serve unsloth/Qwen3.6-35B-A3B-NVFP4-Fast \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
python -m sglang.launch_server \
--model-path unsloth/Qwen3.6-27B-NVFP4 \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4
方案三:Unsloth Studio(最簡單)如果你不想折騰命令行,Unsloth Studio 提供了完整的 Web UI:
# 安裝
curl -fsSL https://unsloth 。ai/install。sh | sh# 啟動
unsloth studio -p 8888
打開瀏覽器搜索 Qwen3.6,下載模型就能直接跑,Studio 會自動幫你設置最優的推理參數,包括 MTP 配置
部署為 API 服務
跑起來之后,可以直接用 OpenAI 兼容的 API 調用:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="sk-no-key-required",
)completion = client.chat.completions.create(
model="unsloth/Qwen3.6-27B-NVFP4",
messages=[{"role": "user", "content": "幫我寫一個 Snake 游戲"}],
temperature=0.6,
top_p=0.95,
extra_body={"top_k": 20},
)
print(completion.choices[0].message.content)
這意味著你可以把它接入 Claude Code、Codex、或者任何支持 OpenAI API 的工具鏈
和其他方案的對比
Unsloth NVFP4
NVIDIA NVFP4
Unsloth GGUF + MTP
Ollama
速度
?????
??
???
??
精度
?????
????
????
???
易用性
????
???
?????
?????
GPU 要求
Blackwell
Blackwell
任意
任意
推薦場景
高吞吐生產部署
生產部署
個人開發/本地
入門體驗
總結
Unsloth 這次的 Dynamic NVFP4 量化,核心創新就三個字:W4A4——把權重和激活值都壓到 4-bit,直接用 Blackwell 的 FP4 Tensor Core 做原生計算,繞過了傳統方案的反量化瓶頸
對于有 Blackwell GPU 的用戶來說,這基本是目前跑 Qwen3.6 最快的方案,27B 模型只需要 24GB VRAM,精度還跟 BF16 齊平,對于還在用 40 系卡的同學,Unsloth 的 Dynamic GGUF + MTP 依然是最優選擇
最后的最后,提醒一下:不要用 CUDA 13.2(會輸出亂碼),用 13.2 以下或者 13.3 版本
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.