關(guān)于本地部署和量化,我之前寫(xiě)過(guò)不少:
今天聊一套讓我眼前一亮的東西——來(lái)自同一個(gè)團(tuán)隊(duì)的三件套:JANG + vMLX + MLX Studio,這可能是目前最能打的方案
它們仨是啥關(guān)系?
先別被三個(gè)名字搞暈了
如果你玩過(guò) PC 端的 GGUF + llama.cpp + Open WebUI,這三個(gè)的關(guān)系你一眼就懂:
層次
PC 端類(lèi)比
Mac 端(這套)
量化格式
GGUF
JANG
推理引擎
llama.cpp
vMLX
桌面應(yīng)用
Open WebUI
MLX Studio
簡(jiǎn)單說(shuō):JANG 把大模型壓小,vMLX 把它跑快,MLX Studio 給你一個(gè)漂亮的界面。三件套,一條龍。
JANG:MLX 的量化救星
先聊最底層的 JANG,官方管自己叫"The GGUF for MLX"
說(shuō)白了,就是一種混合精度量化方案
普通量化對(duì)所有參數(shù)一刀切,但模型里的 Attention 層對(duì)精度極其敏感,切太狠直接出 NaN(無(wú)效數(shù)值),模型就廢了![]()
JANG 的聰明之處在于:對(duì)不同層給不同精度
Attention 層:保留 5~8 bit(不敢動(dòng))
MLP 層:壓到 2~4 bit(這里水分多,使勁壓)
平均額外開(kāi)銷(xiāo):只多 0.3 bit
效果有多猛?看這組數(shù)據(jù)——230B 參數(shù)的 MiniMax M2.5 為例:
量化方式
大小
MMLU(200 題)
JANG_2L(2bit 混合)82.5 GB74%
MLX 4-bit
119.8 GB
26.5%
MLX 3-bit
93 GB
24.5%
MLX 2-bit
68 GB
25%
MLX 在各種 bit 下都只有 25% 左右——純隨機(jī)猜測(cè)水平,模型等于報(bào)廢了。JANG 的 2bit 混合版不但活得好好的,還拿了 74%,體積反而更小。
這差距也太離譜了
![]()
更夸張的是 397B 參數(shù)的 Qwen3.5:
JANG_1L:112 GB,塞進(jìn) 128 GB MacBook Pro,MMLU 86.5%
MLX 2-bit / 3-bit:NaN,直接寄
MLX 4-bit:需要約 280 GB,地球上沒(méi)幾臺(tái) Mac 裝得下
397B 模型在筆記本上跑起來(lái)了——這句話放兩年前說(shuō)出來(lái)怕是要被當(dāng)成瘋子。
![]()
所有量化好的模型都放在 HuggingFace 的 JANGQ-AI 上,下載即用。想自己量化的話,代碼在 github.com/jjang-ai/jangq,Apache 2.0 開(kāi)源。
vMLX:100K 上下文快 224 倍![]()
有了好的量化模型,還得有個(gè)快引擎
vMLX 就是干這個(gè)的
安裝極簡(jiǎn):
pip install vmlx
vmlx serve mlx-community/Qwen3-8B-4bit
啟動(dòng)后在本地http://0.0.0.0:8000提供 OpenAI + Anthropic 兼容 API,Claude Code、Anthropic SDK 這些客戶端都能直接接
![]()
vMLX 最硬核的賣(mài)點(diǎn)是它的五層緩存棧——其他 Mac 端引擎最多有一兩層,vMLX 全給你堆滿了:
前綴緩存:對(duì)話中重復(fù)的部分只算一次
分頁(yè) KV 緩存:多個(gè)對(duì)話同時(shí)駐留,切換不驅(qū)逐
KV 緩存量化:q4/q8 壓縮,節(jié)省 4~8 倍內(nèi)存
持續(xù)批處理:最多 256 個(gè)并發(fā)序列
磁盤(pán)緩存:重啟后立即恢復(fù),不用重新算
五層疊加的結(jié)果就是,首個(gè) Token 的響應(yīng)速度碾壓同類(lèi):
上下文長(zhǎng)度
vMLX
其他引擎
快多少
2.5K
0.05s
0.49s
9.7×
10K
0.08s
6.12s
76×
100K
0.65s
131s
224×
100K 上下文,別的引擎要等兩分多鐘,vMLX 不到一秒。我第一反應(yīng)是"不可能",但這是實(shí)測(cè)的 TTFT(Time to First Token),五層緩存疊加確實(shí)恐怖。
除了緩存,還有幾個(gè)值得一提的特性:
推測(cè)解碼:小模型打草稿 + 大模型驗(yàn)證,提速 20~90%
Mamba / SSM 混合架構(gòu)支持:Nemotron-H 這些奇葩架構(gòu)只有 vMLX 能跑
20+ 內(nèi)置 Agent 工具:文件讀寫(xiě)、代碼搜索、Shell 執(zhí)行、Git 操作、網(wǎng)頁(yè)搜索——全部本地運(yùn)行
最后這點(diǎn)很有意思。vMLX 是目前唯一把 Agentic 工具內(nèi)置到本地引擎里的方案,不用額外配 MCP 服務(wù)器,模型直接就能讀文件、執(zhí)行命令、搜索代碼庫(kù)。這個(gè)思路比 Ollama、LM Studio 激進(jìn)得多。
![]()
項(xiàng)目地址:github.com/jjang-ai/vmlx,Apache 2.0 開(kāi)源。
MLX Studio:不碰命令行也能玩
如果你覺(jué)得命令行太折騰,MLX Studio就是給你準(zhǔn)備的——vMLX 引擎的完整 GUI 應(yīng)用,永久免費(fèi)。
![]()
MLX Studio 主界面——聊天、Agent 工具、圖像生成一體化
該有的全有了:
對(duì)話:流式多輪對(duì)話、折疊式思維鏈展示(DeepSeek R1、Qwen3、GLM)、拖拽圖片做視覺(jué)分析、語(yǔ)音朗讀回復(fù)。
圖像生成:5 個(gè)生成模型(Flux Schnell/Dev、Z-Image Turbo、Klein 4B/9B)+ 4 個(gè)編輯模型(Qwen Image Edit、Flux Kontext、Flux Fill、Flux Klein Edit),全部本地跑,零 API 費(fèi)用。
模型管理:內(nèi)置 HuggingFace 瀏覽器一鍵下載、GGUF → MLX 轉(zhuǎn)換器(支持 JANG 混合精度)、菜單欄快捷切換模型。
API 集成:同時(shí)提供 OpenAI 和 Anthropic 端點(diǎn),支持 Claude Code 等客戶端直接對(duì)接。原生 MCP 支持,可以掛外部工具。
![]()
老實(shí)說(shuō),從功能完整度來(lái)看,MLX Studio 比之前我試過(guò)的 oMLX 豐富不少,尤其是圖像生成和 Agent 工具這塊,oMLX 是沒(méi)有的。不過(guò) oMLX 勝在輕量簡(jiǎn)潔,兩者定位不太一樣。
官網(wǎng):mlx.studio
總結(jié)
這三件套解決的核心問(wèn)題就一個(gè):在 Apple Silicon Mac 上把本地 AI 的體驗(yàn)拉滿。
JANG解決"裝不下"——128GB Mac 跑 397B 模型,MLX 標(biāo)準(zhǔn)量化做不到
vMLX解決"跑不快"——五層緩存棧,100K 上下文快 224 倍
MLX Studio解決"用不了"——圖文生成、語(yǔ)音對(duì)話、Agent 編程,一個(gè) App 搞定
三個(gè)項(xiàng)目全部 Apache 2.0 開(kāi)源,全部免費(fèi)。
有 Mac 跑本地模型需求的朋友,真的值得試試。
制作不易,如果這篇文章覺(jué)得對(duì)你有用,可否點(diǎn)個(gè)關(guān)注。給我個(gè)三連擊:點(diǎn)贊、轉(zhuǎn)發(fā)和在看。若可以再給我加個(gè),謝謝你看我的文章,我們下篇再見(jiàn)!
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.