今天聊點更有意思的:把 Claude Code、Codex、OpenClaw 這三個最火的 Agent 終端,全都接到本地 24GB 顯存的開源大模型上跑
之前對接 Claude Code 的常規姿勢,是把環境變量指到 DeepSeek、Kimi 這種云端 API,體驗不錯,但月底賬單也是真不便宜
Unsloth 團隊最近放了個大招——給自家 Studio 直接掛上了一個 OpenAI 兼容 + Anthropic 兼容 的雙協議 API 端點,本地一條命令起服務,Claude Code、Codex、OpenClaw、OpenCode、Cursor、Cline 全都能直接接
24GB 內存(不論 Mac 統一內存還是 RTX 顯卡)就能跑得起 Gemma 4 26B-A4B 或 Qwen3.6-27B,全程不聯網,自己的代碼不出本機
簡介
先說說 Unsloth API 到底是啥
它其實是 Unsloth Studio(Unsloth 自家的本地推理 UI)開出來的一個對外 HTTP 端口,背后是 llama.cpp 的 llama-server,前面套了一層兼容層,同一個端口同時講兩種話
POST /v1/messages—— Anthropic Messages API,給 Claude Code、Anthropic SDK、OpenClaw 用POST /v1/chat/completions和/v1/responses—— OpenAI 兼容,給 OpenAI SDK、Codex、OpenCode、Cursor、Continue、Cline、Open WebUI 用GET /v1/models—— 列出當前已加載的模型
認證方式跟 OpenAI 一模一樣,請求頭帶 Authorization: Bearer sk-unsloth-…,啟動后 key 在終端里直接打出來一份
![]()
Unsloth API 雙協議示意
最關鍵的是它帶了三個云端 API 才有的高級能力:
Self-healing tool calling :模型偶爾會把工具參數寫歪(少個引號、JSON 嵌套亂了),Unsloth 服務端會自動修一下再喂給客戶端,工具調用成功率明顯高一截
服務端代碼執行 :在請求里加
enable_tools: true和enabled_tools: ["python", "bash"],Bash / Python 直接在服務端沙箱里跑完把結果回流,跟 Claude artifacts 那個味兒差不多Advanced Web Search :模型能真去訪問網頁、讀正文,不是只看一下 snippet
這幾個能力以前是 Claude / OpenAI 這種閉源 API 的護城河,現在全本地化了
安裝
整個鏈路就兩件事:裝 Unsloth Studio,再裝你要用的 Agent CLI
裝 Unsloth Studio(一行)
# macOS / Linux / WSL
curl -fsSL https://unsloth.ai/install.sh | sh# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex
加載一個 GGUF 模型并啟動 API
unsloth run unsloth/Qwen3.6-27B-GGUF
# 或者跑 Gemma 4
unsloth run unsloth/gemma-4-26B-A4B-it-GGUF
啟動完終端會打印出兩行很重要的東西,一行是端口(一般是 http://localhost:8000 或 8888),一行是 sk-unsloth-... 開頭的 API key,這玩意兒只顯示一次,記得馬上存下來
也可以從 UI 里手動建:左下角頭像 → Settings → API → 起個名字 → Create
硬件門檻
24GB 內存能跑哪些模型,Unsloth 官方給了一張實測表,老章挑兩個最值得本地用的列出來:
模型
4-bit 推薦內存
適合誰
Gemma 4 26B-A4B(MoE)
28–30 GB
M-series Mac 32GB 統一內存最穩
Gemma 4 E4B(密集)
9–12 GB
8GB 顯卡也能跑
Qwen3.6-27B
18 GB
24GB 顯存富裕
Qwen3.6-35B-A3B(MoE)
23 GB
24GB 卡踩線,30GB 舒服
老章自己 M4 Pro 48GB 跑 Qwen3.6-27B Q4_K_XL,上下文 32K,吐字速度大概 25 tok/s,寫代碼完全夠用
? ?? 提醒一下,CUDA 13.2 跑 GGUF 現在有 bug 會輸出亂碼,N 卡用戶先用 13.1 或 12.x,NVIDIA 還在修
裝 Claude Code
curl -fsSL https://claude.ai/install.sh | bash
# 或 brew install --cask claude-code
指向 Unsloth 端點
export ANTHROPIC_BASE_URL="http://localhost:8888"
export ANTHROPIC_API_KEY="sk-unsloth-你的key"
關掉那個讓推理慢 90% 的坑
這是個老章踩過的坑,Claude Code 最近會在每次請求前偷偷加一個 attribution header,header 一變 KV Cache 直接全廢,推理速度掉 90%
export CLAUDE_CODE_ATTRIBUTION_HEADER=0 是沒用的,必須寫到配置文件里
cat > ~/.claude/settings.json <<'EOF'
{
"env": {
"CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
}
}
EOF
進項目目錄跑 claude,再 /model 一下確認走的是本地模型,就齊活了
接入 Codex
Codex 現在只認 OpenAI Responses API(Chat Completions 已經在棄用路上),還好 Unsloth 在同一個端口上把 /v1/responses 也開了
裝 Codex
brew install --cask codex
# 或 npm install -g @openai/codex
配置 ~/.codex/config.toml
[model_providers.unsloth]
name = "unsloth"
base_url = "http://localhost:8888/v1"
wire_api = "responses"
env_key = "UNSLOTH_API_KEY"[profiles.local]
model_provider = "unsloth"
model = "Qwen3.6-27B-GGUF"
export UNSLOTH_API_KEY="sk-unsloth-你的key"
codex --profile local
模型 ID 不知道寫啥,直接 curl http://localhost:8888/v1/models 把 id 字段抄過去
接入 OpenClaw
OpenClaw 是個開源 Agent 終端,用 Anthropic Messages 協議跟模型說話,跟 Unsloth 是天作之合
裝 OpenClaw
curl -fsSL https://openclaw.ai/install.sh | bash
編輯 ~/.openclaw/openclaw.json
{
"models": {
"mode": "merge",
"providers": {
"unsloth": {
"baseUrl": "http://localhost:8888/v1",
"api": "anthropic-messages",
"authHeader": true,
"apiKey": "sk-unsloth-你的key",
"models": [
{ "id": "Qwen3.6-27B-GGUF", "name": "Qwen3.6 本地" }
]
}
}
}
}
注意 baseUrl 必須以 /v1 結尾,api 寫 anthropic-messages 是告訴 OpenClaw 走 /v1/messages 這條路
實測體驗
老章用 Qwen3.6-27B 在 Claude Code 里跑了一上午,幾個真實感受寫在這
好的方面
第一次 cold start 大概 30 秒,之后提示詞響應秒回,本地跑不用等隊列
self-healing tool calls 真的有用,之前直接掛 llama.cpp 給 Claude Code 用,工具調用十次有三次參數 JSON 裂開,Unsloth 這邊幾乎沒翻車
隱私這塊踏實,公司項目敏感代碼再也不用糾結要不要傳出去
不用再盯賬單了,電費怎么也比 API token 便宜
不太好的地方
27B 4-bit 比起 Claude Sonnet 4 / GPT-5 這種頂級模型,長鏈路任務(比如重構十幾個文件)還是會糊,復雜任務老章建議拆小步喂
工具調用響應整體比云端慢一點,尤其是帶 web search 的,本地瀏覽器抓頁面就是慢
Codex 現在一定要
wire_api = "responses",老的chat模式已經不推薦,配錯了會一直 400
我的建議
把它當 日常副駕 用,寫腳手架、改 bug、跑測試、刷文檔,本地模型完全夠用,性能還穩定不限速
真要啃硬骨頭(架構設計、跨多文件大重構),切回 Claude / GPT-5 這種頂級 API,按需混用最劃算
One More Thing
Unsloth 這一手在我看來意義挺大的——以前本地跑 Agent,瓶頸不在模型,而在 協議生態
llama.cpp 自己有 OpenAI 兼容端點,但 Claude Code 走的是 Anthropic 協議,兩邊對不上;想接 Claude Code 就得自己寫代理層,門檻勸退
Unsloth 直接把 OpenAI 和 Anthropic 兩個協議都喂在同一個端口上,再把 self-healing、tool calling、code execution、web search 這些原本要各家 SDK 各搞一遍的能力做成服務端默認開啟
裝一次,三家 CLI 全通,這才是本地 Agent 應該有的樣子
如果你之前因為生態不全沒真的把 Claude Code 接到本地用過,這次值得再試一遍
文檔地址:unsloth.ai/docs/basics/api
制作不易,如果這篇文章覺得對你有用,可否點個關注。給我個三連擊:點贊、轉發和在看。若可以再給我加個,謝謝你看我的文章,我們下篇再見!
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.