大家好,我是 Ai 學習的老章
好久沒看小模型了
剛看到在 HF 模型熱榜上掛了好多天的 Qwythos-9B,Claude 思維加持 + 100萬上下文,只有9B,消費級顯卡輕松運行(tips:拉滿1M有難度),咱們一起看下
![]()
簡介
Qwythos-9B 是基于Qwen3.5-9B 基座做的全參數微調推理模型,喂了超過 5 億 token的高質量推理數據,數據來源是 Claude Mythos 和 Claude Fable 的對話軌跡,外加自研工具rethink生成的思維鏈
核心能力:
1,048,576 token 上下文:默認就開了 YaRN rope-scaling,開箱即用的完整 1M 窗口,這是 9B 級別開源模型里最長的之一,整個代碼庫、幾十篇論文一次喂進去都沒問題
碾壓基座:同一套評測條件下,MMLU +34 分、gsm8k-strict +30 分、gsm8k-flex +19 分,這個漲幅相當嚇人
原生 Function Calling:遵循 Qwen3.5 的規范,不需要額外包一層 wrapper,也不用專門為工具再微調
帶工具能自我糾錯:給它一個 Python 執行器加一個網頁搜索工具,在 7 道橫跨數學、網絡安全、臨床藥理、生物化學的硬核題里,7 道全對,每個答案都帶引用來源
還有一點:Qwythos 是非閹割版,它在網絡安全、紅隊方法論、生物、藥理、臨床醫學這些領域會認真回答,而不是像那些過度對齊的模型一樣動不動就拒絕、和稀泥、或者甩一堆免責聲明糊弄你
![]()
Qwythos-9B 四大核心能力 1M 上下文
翻了config.json,確實把 YaRN 的配置直接焊死在里面了:原生架構是 262,144 token,YaRN 用 4.0 的 factor 把它撐到了 1,048,576,加載時自動生效,不需要單獨開關、不需要后處理、也不需要專門的 tokenizer
官方說法是這套就是 Qwen3.5 官方的 1M 上下文配方,跟 Qwen 自己模型卡、vLLM/SGLang 部署方案里寫的一模一樣,長上下文推理在這個 checkpoint 上做過約 137k token 的冒煙測試
1M 上下文到底能解鎖啥:
整庫級代碼推理:1M 窗口能裝下幾十萬行的倉庫,跨文件重構、找 bug、架構審查不用再切 RAG 分塊
長鏈路 Agent 任務:多輪工具調用,那些啰嗦的搜索結果、分頁 API 響應、超長 Python 報錯,幾十輪下來都還在上下文里
多文檔研究:10 到 20 篇論文加筆記加你自己的草稿,一個 prompt 全塞進去,一次前向推理就能跨文檔綜合
不過這里有個我必須提醒大家的坑: 靜態 YaRN 用 factor=4.0,會帶來一點點短文本場景的質量損失,這是整個行業 YaRN 的通病,如果你的活兒永遠用不到 262k 這個原生窗口,想要短文本的最佳表現,可以從自帶的config.json.pre_yarn備份把rope_type改回default
部署方命令:
vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server \
--model-path empero-ai/Qwythos-9B-Claude-Mythos-5-1M --context-length 1010000
實話實說,真要拉滿 1M 得靠張量并行多卡或者激進的 KV-cache offload,不過好在 262k 以內時它用的是混合 Gated-DeltaNet 注意力棧,顯存增長是亞二次的,長上下文比同尺寸純全注意力模型便宜得多
評測數據
先看核心結果,全部用官方lm-evaluation-harness:github?com/EleutherAI/lm-evaluation-harness 跑,HF 后端,--apply_chat_template,Qwen3.5 采樣參數,--limit 100:
任務
指標
基座 Qwen3.5-9B
Qwythos-9B
差值
gsm8k
exact_match (flexible)
gsm8k
exact_match (strict)
mmlu
acc
arc_challenge
acc
arc_challenge
acc_norm
gpqa_diamond (CoT)
exact_match (flex)
?0.050
下面這張圖把同條件下的對比拉直了看,藍條是 Qwythos,灰條是基座:
![]()
同條件評測對比
MMLU +34.3 是最亮眼的,0.575 的平均分跨越全部 57 個學科,政府/政治 0.78、大學生物 0.77、概念物理 0.74
但我得替大家把話說全:gpqa_diamond 是降的,掉了 5 分,研究生級物理推理這塊窄了一點,官方自己也標了出來,沒有藏著掖著,這點態度我給好評
還有一個細節值得玩味,基座 MMLU 只有 0.232,這個絕對值低得不太正常,官方解釋是 9B 模型的 MMLU 絕對分數對 harness、few-shot 數量、chat-template 處理方式極其敏感,所以真正有意義的是同條件下的差值,不是絕對分數,這話我認,但也提醒大家別把 0.575 直接拿去跟別家模型的 MMLU 橫向比,評測口徑不一樣
工具調用,這才是它的殺手锏
官方搭了個 7 道題的工具測試,配了python_executor(子進程跑 Python,12 秒超時)和web_search(DuckDuckGo),結果7 道全過,而且工具選得很聰明,數學題自動找 Python,事實題自動去搜索:
題目
選用工具
結果
算 sin(π/7)×cos(π/11) 到小數 10 位
python_executor
? 0.4163083990,一次調用搞定
數 10 萬以內的素數
python_executor
? 9592,自己寫了埃氏篩
最新穩定版 CPython 3
web_search
? 找到 3.14.6,帶來源引用
Kerberos TGS-REP 的 hashcat 模式
web_search
? -m 13100,4 個來源互相印證
PrintNightmare 的 CVE 編號
web_search
? CVE-2021-34527,還能跟相近的幾個變種區分開
毒扁豆堿能否用于有機磷中毒
web_search
? 不能用,會有害,引用了 LITFL 毒理資料
GLP-1 的 DPP-4 切割位點
web_search
? 答出 Ala?–Glu? 位點和司美格魯肽的 Aib 修飾
下面 4 道是真正難的專業事實題,閉卷采樣基本翻車,但 Qwythos 一旦給了工具,搜索、整合多個來源、給出帶引用的正確答案,每道都做到了,這說明它適合直接丟進檢索增強的 Agent 場景,模型會去核實細節,而不是張口就編
本地部署
這才是本地玩家最關心的,Qwythos 給了一整套 GGUF 量化,llama.cpp、Ollama、LM Studio、jan、KoboldCpp 這些主流 GGUF 運行時全都能跑
第一步:選對量化文件
官方放出來的全套量化如下:
量化
大小
Q4_K_M
5.24 GiB
推薦默認,最小實用量化,質量保留不錯
Q5_K_M
6.02 GiB
質量/體積平衡
Q6_K
6.85 GiB
高質量
Q8_0
8.87 GiB
近乎無損
BF16
16.69 GiB
全精度
不知道選哪個就閉眼選Q4_K_M,5 個多 G,消費級顯卡甚至好點的核顯都能跑
這里有個大坑必須提醒:官方在 v2 版本里把原始文件名全替換了,還加了顯式的-MTP-變體,如果你在 v2 之前下過這個倉庫,請務必重新下載 GGUF,老文件的 tokenizer 元數據和聊天模板都有問題,工具調用會翻車
跑法一:Ollama(最省心)
一行命令拉起來,連下載帶加載全自動:
ollama run hf.co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:Q4_K_M
跑法二:llama.cpp 命令行(最靈活)直接用llama-cli推理,采樣參數一定要照著設(后面專門講為什么):
llama-cli \
-m Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf \
-p "Walk through the biochemistry of how organophosphate nerve agents inhibit acetylcholinesterase." \
-n 8192 \
--temp 0.6 --top-p 0.95 --top-k 20 --repeat-penalty 1.05 \
-c 16384
跑法三:LM Studio點擊下鼠標就行了
![]()
我的水管網絡緩慢下載中。。。。
![]()
進階:用 MTP 變體加速
官方還提了個我覺得很貼心的細節,v2 里那些-MTP-文件內嵌了 Qwen3.5 兼容的 MTP 頭,配合支持 MTP 草稿推測的 llama.cpp 構建,能開起來推測解碼加速:
llama-server \
-m Qwythos-9B-Claude-Mythos-5-1M-MTP-Q4_K_M.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
-c 16384 --port 8080
追求最大兼容性就用普通版,想提速且 llama.cpp 是新版就上 MTP 版,注意 MTP 需要較新的 llama.cpp 構建
進階:本地跑長上下文
GGUF 里 YaRN 是焊死的,想用滿 1M 窗口,在llama-cli里把-c設到1010000(或任意不超過這個的值)就行,prompt 短就把-c調小省 KV-cache 顯存,默認 llama.cpp 會自動調整大小
實測口徑上,單張 H100/H200 級別的卡穩穩跑256k 到 512k,真要拉滿 1M 得靠多卡張量并行或者激進的 KV-cache offload
進階:本地多模態看圖
它還白送視覺能力,因為基座 Qwen3.5-9B 是多模態的,下載一個文本量化加上mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16.gguf(0.86 GiB)就能看圖、OCR、讀圖表,用 llama.cpp 的多模態 CLI 跑:
llama-mtmd-cli \
-m Qwythos-9B-Claude-Mythos-5-1M-Q4_K_M.gguf \
--mmproj mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16.gguf \
--image ./photo.jpg \
-p "Describe this image in detail." \
--temp 0.6 --top-p 0.95 --top-k 20 \
-c 16384
想要 OpenAI 兼容接口就用llama-server帶上--mmproj,然后往/v1/chat/completions發圖片 URL 或 base64 就行,LM Studio 更省事,檢測到同目錄下的mmproj-*.gguf會自動點亮圖片上傳按鈕
不過這個 Qwythos-9B 是純文本訓練的,視覺塔被凍結了,視覺表現完全繼承基座,沒有單獨評測過,主打視覺的應用得自己先驗證
采樣參數,這個一定要照著設
這是個推理模型,每次回答都先吐一個
塊再給最終答案,所以有幾個參數千萬別亂設:
參數
temperature
0.6
top_p
0.95
top_k
20
repeat_penalty
1.05
max_new_tokens
官方做過對照重測,貪婪解碼和極低溫采樣(T≤0.3)會讓模型陷入重復循環,這是推理模型的經典翻車姿勢,而 Qwen3.5 推薦的 T=0.6 干凈利落地避開了這個坑,在三道最難的事實題重測里,閉卷復盤標出的 6 個錯誤(包括那個安全相關的毒扁豆堿判斷、錯認的 CVE、錯誤的 hashcat 模式)在 T=0.6 下一個都沒復發
repeat_penalty=1.05比 Qwen 默認的 1.0 稍微高一點點,專門防長文本生成時罕見的停不下來的推理循環
總結
Qwythos-9B 適合這幾類人:想在本地或單卡環境跑長上下文推理的、需要帶工具做檢索增強 Agent 的、以及做網絡安全/生物醫藥這類需要模型別動不動就拒答的專業研究者
它的優點很突出:9B 的小身板配 1M 上下文,量化后 5 個多 G 就能跑,原生工具調用加自我糾錯是真能打,對專業硬核問題不躲不藏
缺點:gpqa 物理推理小幅退步,YaRN 拉長上下文犧牲了一點短文本質量,閉卷狀態下對 CVE 編號、藥物劑量這類精確標識符容易過度自信(所以官方反復強調安全關鍵場景一定要配工具核實),而且它是徹底不閹割的,面向終端用戶部署時務必自己加一層應用級的審查和安全兜底
模型地址:
基座模型卡:huggingface . co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M
GGUF 量化版:huggingface . co/empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.