編輯|Panda
2026 年 6 月,智譜開源 GLM-5.2。這個(gè)大規(guī)模 MoE 模型表現(xiàn)優(yōu)異,就連 Next.js 作者、Vercel 創(chuàng)始人 Guillermo Rauch 都震驚了。
![]()
GLM-5.2 確實(shí)是一個(gè)非常強(qiáng)的底座,但再強(qiáng)的基座,訓(xùn)練結(jié)束、參數(shù)凍結(jié)、進(jìn)入部署后,就很難再在真實(shí)使用中繼續(xù)成長。智譜在 GLM-5.2 的規(guī)劃里也表示,下一步要攻克的關(guān)鍵技術(shù)包括記憶、持續(xù)學(xué)習(xí)和自我評判。也就是說,規(guī)模擴(kuò)增之外的另一個(gè)方向是模型在使用中成長。
心洲科技旗下的前沿實(shí)驗(yàn)室 Mind Lab 前些天開源的Macaron-V1就是沖著這個(gè)方向去的。它沒有另起爐灶,而是站在了巨人的肩膀上:基座升級至 GLM-5.2(另有基于 Qwen3.6 的更小版本),原生支持 2M 上下文,然后在此強(qiáng)大基座之上,做了一件 GLM-5.2 正在規(guī)劃的事:讓模型持續(xù)學(xué)習(xí),并讓大量模型協(xié)作。
![]()
也就是說,Macaron-V1 押注的是這兩個(gè)關(guān)鍵詞:持續(xù)學(xué)習(xí)與群體智能。它們分別對應(yīng)于其技術(shù)博客中的adaptation(適應(yīng))與collaboration(協(xié)作)。
在 Mind Lab 看來,下一代 AI 的決定性因素不再主要是把單一的單體模型繼續(xù)擴(kuò)大,而是兩種相輔相成的能力:通過遞歸自我改進(jìn)(RSI)進(jìn)行后訓(xùn)練,讓模型持續(xù)生成經(jīng)驗(yàn)、從中學(xué)習(xí)、改善自身行為;以及多智能體協(xié)作,讓專業(yè)化模型與智能體構(gòu)建在共享基礎(chǔ)設(shè)施之上并相互組合。
這條路線走通了嗎?基準(zhǔn)給出了肯定答案:在所測任務(wù)上,Macaron-V1 的成績均優(yōu)于基座 GLM-5.2 ,在某些基準(zhǔn)上還實(shí)現(xiàn)了當(dāng)前最佳甚至遙遙領(lǐng)先。比如在考驗(yàn)前端設(shè)計(jì)能力的 UI4A 基準(zhǔn)上,Macaron-V1 以 87.7 的成績大幅領(lǐng)先 Claude Opus 4.8。
![]()
我們的實(shí)測體驗(yàn)也印證了這一點(diǎn)。下面是用配置了 Macaron-V1 的 Claude Code 構(gòu)建的單個(gè)模擬 macOS 的網(wǎng)頁文件,整個(gè)執(zhí)行過程耗時(shí) 22 分鐘,成果是一個(gè) 67 KB 的 HTML 文件,但效果有點(diǎn)超出預(yù)期:不僅計(jì)算器和照片等功能高度可用,甚至還支持天氣、瀏覽器、翻譯等需要聯(lián)網(wǎng)的應(yīng)用。
![]()
https://mp.weixin.qq.com/s/CHXgDg4hn8n7DpnFzaCQcQ
另外,我們還讓其生成了一個(gè)物理學(xué)家模擬聊天群動(dòng)態(tài)截圖,也相當(dāng)有趣,Macaron-V1 甚至為各位物理學(xué)家生成了帶有各自特征的 SVG 作為頭像:
![]()
https://mp.weixin.qq.com/s/CHXgDg4hn8n7DpnFzaCQcQ
值得注意的是,這些超越基座的能力僅僅來自掛載其上的幾個(gè)小小的LoRA。
而這背后,還暗含了一個(gè)正在形成的行業(yè)共識:把數(shù)據(jù)之上的「經(jīng)驗(yàn)」當(dāng)作下一代 AI 的燃料。
Richard Sutton 與 David Silver 在 2025 年的一篇著名博文直接把下一個(gè)階段命名為「經(jīng)驗(yàn)時(shí)代」」。而近期在網(wǎng)上瘋傳的梁文鋒四小時(shí)投資者交流會(huì)講話內(nèi)容中也提到了持續(xù)學(xué)習(xí),他還預(yù)測「持續(xù)學(xué)習(xí)之后,可能我們就會(huì)來到一個(gè)奇點(diǎn)。」
![]()
來自《Welcome to the Era of Experience》, David Silver & Richard S. Sutton
而在工程側(cè),明星創(chuàng)業(yè)公司 Thinking Machines Lab 也在驗(yàn)證一條高度相似的技術(shù)路徑:用 LoRA 這類高效后訓(xùn)練手段,如果配置得當(dāng),可達(dá)到接近全參數(shù)微調(diào)的效果,同時(shí)還能大幅降低算力開銷。
一邊是理念層面的方向判斷,一邊是工程層面的可行性驗(yàn)證,而 Macaron-V1 要做的是把兩者同時(shí)在一個(gè)千億參數(shù)量級的開源模型上真正跑通。
訓(xùn)練結(jié)束,不該是學(xué)習(xí)結(jié)束
Macaron-V1 為何這樣設(shè)計(jì)?要解答這個(gè)問題,需先看清當(dāng)今大模型共同的天花板。
今天的大模型已經(jīng)擁有廣泛的知識,能完成復(fù)雜的推理、規(guī)劃和工具調(diào)用。但它們的能力基本都是在少數(shù)幾次集中訓(xùn)練中獲得的,訓(xùn)練結(jié)束后參數(shù)就被凍結(jié),以相對固定的狀態(tài)進(jìn)入部署。然而許多有價(jià)值的信息部署之后才會(huì)出現(xiàn),比如用戶的長期偏好、具體代碼庫獨(dú)特的架構(gòu)、某項(xiàng)任務(wù)反復(fù)失敗的原因……
集中訓(xùn)練可以覆蓋共性,卻不可能提前窮舉每一種環(huán)境和每一位用戶的偏好。對一個(gè)長期運(yùn)行的智能體來說,部署之后正是經(jīng)驗(yàn)大量涌現(xiàn)的開始,而這理應(yīng)也可以成為新一輪學(xué)習(xí)的起點(diǎn)。
Mind Lab 把自己想構(gòu)建的東西稱作「經(jīng)驗(yàn)智能機(jī)器」(Experiential Intelligence Machine):機(jī)器從自己的經(jīng)歷中學(xué)習(xí),經(jīng)驗(yàn)轉(zhuǎn)化為新能力,新能力讓它能解決更難的問題,更難的問題又帶來更豐富的經(jīng)驗(yàn)。智能由此成為了一個(gè)持續(xù)生長的過程。
![]()
那么,問題來了,具體該怎么做呢?
Mind Lab 判斷大致有兩條路徑:
- 提示詞空間的迭代:通過提示詞、外掛記憶、RAG、skill、harness 等方式把經(jīng)驗(yàn)保存在模型之外,每次用時(shí)重新讀取;
- 參數(shù)空間的迭代:把經(jīng)驗(yàn)寫進(jìn)模型的可訓(xùn)練狀態(tài)。
前者已經(jīng)帶來顯著價(jià)值,但有個(gè)結(jié)構(gòu)性約束:經(jīng)驗(yàn)存在模型之外,隨著經(jīng)驗(yàn)增加,每次重新讀取、重新理解的成本會(huì)越來越高,而且把信息塞進(jìn) context 并不等于模型真的掌握了其中規(guī)律。
Macaron-V1 押的是后者,并且它選的是一條更輕量的路:LoRA。
MoL 架構(gòu):把「持續(xù)學(xué)習(xí)」做成可插拔的模塊
Macaron-V1 的核心是Mixture-of-LoRA(MoL)架構(gòu)。其思路很容易理解:技能和思維模式相近的任務(wù)歸進(jìn)同一個(gè) LoRA,讓它們相互強(qiáng)化;技能差異大的任務(wù)分到不同 LoRA,各自獨(dú)立、互不干擾。
具體到 Macaron-V1,則是在一個(gè)凍結(jié)的 GLM-5.2 基座上,搭載四個(gè) 1B 的 LoRA 專家:
- L0 Chat:負(fù)責(zé)對話與指令遵循的主干
- L1 Agent:負(fù)責(zé)重度工具使用與長程復(fù)雜任務(wù)
- L2 Coding:負(fù)責(zé)代碼理解與終端使用
- L3 GenUI:負(fù)責(zé)生成式 UI 渲染與 UI 驅(qū)動(dòng)操作
新能力以插件式的 LoRA 加入,不動(dòng)搖已有知識,不同來源的專家還能在同一基座上自由組合。
這正是 Macaron-V1 旗艦版 Venti 的構(gòu)成:748B 的總參數(shù),由一個(gè) 744B 的 GLM-5.2 基座和四個(gè) 1B 的 LoRA 專家組成。另有一個(gè)面向本地部署的 Tall 版本,總參 50B,由 35B 基座和四個(gè) 3.7B 的 LoRA 專家構(gòu)成,基于 Qwen3.6。
![]()
三種不同的能力擴(kuò)展方式:MoE、Skills、MoL
但 MoL 的重要性更體現(xiàn)在它讓 LoRA 翻了身。
過去,LoRA 這類參數(shù)高效微調(diào)(PEFT)方法,長期被當(dāng)成全參數(shù)微調(diào)的「廉價(jià)替代品」。
Mind Lab 則通過實(shí)踐給出了不同答案:適配器(adapter)不該只被看作省錢工具,而應(yīng)被看作一種「持久的本地狀態(tài)」。共享的基礎(chǔ)模型提供通用能力是「共性」;適配器承載某個(gè)具體實(shí)例的個(gè)性化行為(比如偏好、技能、工具使用習(xí)慣,以及類似記憶的更新)則是「個(gè)性」。LoRA 可以超越靜態(tài)補(bǔ)丁,成為可寫入并會(huì)隨交互演化的記憶。
這個(gè)判斷已有實(shí)驗(yàn)支撐。在 Mind Lab 的 On the Scaling of PEFT 研究中,團(tuán)隊(duì)已在萬億參數(shù)的稀疏 MoE 模型 Kimi K2 上跑通了 LoRA 強(qiáng)化學(xué)習(xí),算力與通信開銷壓到全參數(shù) RL 的約 10%,訓(xùn)練曲線穩(wěn)定。
![]()
GRPO LoRA 訓(xùn)練在大規(guī)模 LLM 上的應(yīng)用。穩(wěn)定的獎(jiǎng)勵(lì)與任務(wù)成功曲線表明,聯(lián)合設(shè)計(jì) rollout、訓(xùn)練及混合并行化時(shí),通過基于 LoRA 的強(qiáng)化學(xué)習(xí)來適配萬億參數(shù) MoE 推理模型是可行的。來自論文《On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters》,arXiv:2606.02437
更值得看的是另一組對比:在相近的 RL 預(yù)算下,1.5B 模型做全參數(shù) RL,可訓(xùn)練參數(shù) 1.5B,AIME 2025 上的歸一化增益為 8.33%;7B 模型用 r=64 的 LoRA,可訓(xùn)練參數(shù)降到 0.16B,增益反而升到 11.31%;32B 模型用 r=8 的 LoRA,可訓(xùn)練參數(shù)只剩 0.07B,增益達(dá)到 20.61%。可訓(xùn)練的那一小塊越小,底座越強(qiáng),拿到的增益反而越高。
![]()
在相近的強(qiáng)化學(xué)習(xí)預(yù)算下,大先驗(yàn)加小規(guī)模 LoRA 更新可超越全量強(qiáng)化學(xué)習(xí)在小模型上的表現(xiàn)
群體智能:多個(gè) LoRA 協(xié)作,實(shí)現(xiàn)持續(xù)提升
既然 LoRA 是可插拔、可持續(xù)新增的,那么一個(gè)問題就自然涌現(xiàn)出來:能否讓多個(gè) LoRA 協(xié)作?
Mind Lab 的答案:群體智能。
邏輯不難理解:一旦模型能沿著自身經(jīng)歷持續(xù)學(xué)習(xí),不同實(shí)例就會(huì)逐漸走向不同方向:不同用戶提供不同反饋,不同任務(wù)產(chǎn)生不同策略,不同環(huán)境塑造不同能力。即使從同一個(gè)基礎(chǔ)模型出發(fā),長期學(xué)習(xí)之后也會(huì)分化出大量不同的 LoRA、Agent 和策略。因此,多樣性是自我迭代的自然結(jié)果,并可能成為智能的新來源。
論文給出了實(shí)驗(yàn)證據(jù)。Mind Lab 從相同的 Qwen3-30B 基礎(chǔ)模型出發(fā),保持訓(xùn)練目標(biāo)和強(qiáng)化學(xué)習(xí)方法一致,只改變數(shù)據(jù)順序和 masking。在 AIME24 上,單個(gè) adapter 的準(zhǔn)確率是 36.44%;把 198 個(gè)不同 adapter 做多數(shù)投票,準(zhǔn)確率提高到 48.67%;而從同一個(gè) adapter 做相同規(guī)模的重復(fù)采樣,最高只到 43.78%。
![]()
基于多數(shù)投票的模型計(jì)數(shù)擴(kuò)展
這個(gè)結(jié)果說明,不同學(xué)習(xí)軌跡帶來的差異,包含了超出普通采樣的互補(bǔ)性。這又進(jìn)一步表明:群體不是簡單的重復(fù),而是真的更聰明。
比投票更進(jìn)一步的是路由。一個(gè)復(fù)雜任務(wù)可能同時(shí)需要規(guī)劃、編程、檢索和 UI 生成,不同 LoRA 或 Agent 可以負(fù)責(zé)不同階段,也可以在執(zhí)行過程中動(dòng)態(tài)切換。具體到 Macaron-V1,MoL 可讓多個(gè)獨(dú)立訓(xùn)練的 specialist LoRA 共存于同一個(gè)基礎(chǔ)模型,并根據(jù)任務(wù)動(dòng)態(tài)選擇和組合。
從結(jié)果投票到技能路由,「擴(kuò)展模型數(shù)量」這條路線在這里得到了初步驗(yàn)證。
在大規(guī)模基座上:讓強(qiáng)化學(xué)習(xí)跑起來
上面這些能成立,前提是在大規(guī)模基座上把強(qiáng)化學(xué)習(xí)穩(wěn)定跑起來,而這很難。
須知,強(qiáng)化學(xué)習(xí)有一個(gè)很棘手的問題:訓(xùn)推不一致。訓(xùn)練和推理時(shí)的精度偏差會(huì)不斷漂移,最終讓結(jié)果無法收斂。要壓住它,基礎(chǔ)設(shè)施必須在很高的精度上對齊。而當(dāng)一個(gè)大規(guī)模 MoE 模型做強(qiáng)化學(xué)習(xí)時(shí),它需要分布在多張 GPU 上,不同切片之間的通信、并行計(jì)算,全都要以同樣的精度對齊。
為此,Mind Lab 配了兩套互補(bǔ)的系統(tǒng)。
底層是MinT,MindLab 的旗艦后訓(xùn)練平臺,也是讓 Venti 這個(gè)規(guī)模得以實(shí)現(xiàn)的基礎(chǔ)設(shè)施。
![]()
MinT 概況,來自 Mind Lab 論文《MinT: Managed Infrastructure for Training and Serving Millions of LLMs》,arXiv:2605.13779
MinT 的幾個(gè)關(guān)鍵能力恰好與 MoL 天然契合:
- Actor 與 Learner 之間只傳遞 Adapter,免去搬運(yùn)完整模型權(quán)重的開銷;
- 支持百萬規(guī)模的 Adapter 目錄,也就是可以基于一個(gè)基礎(chǔ)底座,托管、調(diào)用、運(yùn)行上百萬個(gè) LoRA 版本,每個(gè) LoRA 有獨(dú)立身份和版本歷史,評測通過后進(jìn)入部署,也可以隨時(shí)回滾;
- 端到端支持最高萬億參數(shù)規(guī)模的模型。
順帶一提,Mind Lab 已分別與 veRL 和 AReaL 團(tuán)隊(duì)合作構(gòu)建了 MinT 的兩個(gè)開源實(shí)現(xiàn):verl-mint 和 AReaL-MinT。
上層則是MindForge,一個(gè)面向智能體強(qiáng)化學(xué)習(xí)的訓(xùn)練框架。它能把已具備生產(chǎn)就緒能力的 Harness 直接引入強(qiáng)化學(xué)習(xí)閉環(huán),用同樣的路由工具、記憶布局、工具調(diào)用方式和 Harness 結(jié)構(gòu),確保模型訓(xùn)練時(shí)的條件與它最終運(yùn)行時(shí)一致。
其中讓訓(xùn)練和服務(wù)對齊的通信層叫Harness Context Protocol(HCP)。由于訓(xùn)練與服務(wù)用同一套 HCP schema,模型在訓(xùn)練 rollout 里看到的任何信息,在生產(chǎn)環(huán)境中同樣可用。
MindForge 由此可形成RSI 閉環(huán):從種子任務(wù)自動(dòng)構(gòu)建越來越難的任務(wù),驗(yàn)證篩選其學(xué)習(xí)價(jià)值,對生成的軌跡做 rollout 與審計(jì),迭代改進(jìn)配置直到不再有收益,最后把優(yōu)化經(jīng)驗(yàn)固化進(jìn)模型參數(shù)。重復(fù)這個(gè)循環(huán),更新后的模型又能生成更難的任務(wù)、改進(jìn) Harness,持續(xù)擴(kuò)展自己的能力邊界。
還有一個(gè)值得一提的工程細(xì)節(jié)是LongStraw,它跑在 MinT 的訓(xùn)練側(cè),解決的問題是:長上下文推理早就跨過了百萬 token,但強(qiáng)化學(xué)習(xí)訓(xùn)練還沒有。
![]()
LongStraw 執(zhí)行路徑,來自 Mind Lab 與復(fù)旦合作論文《LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget》,arXiv:2607.14952,開源實(shí)現(xiàn):
MindLab-Research/longstraw
傳統(tǒng)的全序列 GRPO 后訓(xùn)練需要針對同一提示詞評估多個(gè)回復(fù),并保留或重建長上下文的反向傳播依賴,因此即使推理上下文已經(jīng)達(dá)到百萬 token,公開的 RL 后訓(xùn)練工作負(fù)載通常仍停留在 256K 或以下。
LongStraw 帶來了改變:它先以無梯度方式處理共享提示詞,將其保存為可復(fù)用的模型原生常駐狀態(tài),隨后串行重放各個(gè)回復(fù)分支、反向傳播并累積梯度。實(shí)驗(yàn)結(jié)果很亮眼:在 32×H20 上,它讓 GLM-5.2 在全部 78 層上完成了同樣 2,097,152 positions 的確定性執(zhí)行與兩次完整反向傳播。
在固定 GPU 預(yù)算下做數(shù)百萬 token 的強(qiáng)化學(xué)習(xí),已經(jīng)從演示走向了工程可行。
模型和 Harness 一起訓(xùn)練
Macaron-V1 有一個(gè)不太常見的設(shè)計(jì)選擇:它的 harness 不是模型訓(xùn)練完之后再補(bǔ)的外殼,而是和模型一起訓(xùn)練出來的。其中這幾個(gè)部分值得單獨(dú)說。
一個(gè)是UI4A,這是 Macaron 的代碼原生 Generative UI 方案。它保留了 HTML 的原生靈活性,同時(shí)支持從 NPM registry 或任意 URL 直接導(dǎo)入庫與組件,讓模型可以即時(shí)交付豐富的交互式內(nèi)容。UI4A 在設(shè)計(jì)上保證了即使沒有針對它專門微調(diào)的模型也能驅(qū)動(dòng),所以它是一個(gè)通用的界面層,而非 Macaron 專屬能力。
![]()
使用 UI4A 的幾個(gè)示例,開源地址:
https://github.com/MindLab-Research/macaron-artifacts
第二個(gè)是REPL Harness,它給模型一個(gè)持久的 Python 命名空間,圍繞 ToolProxy 模式組織:模型可以直接寫代碼把有依賴關(guān)系的步驟串起來;save_tool 可把跑通的流程打包成可復(fù)用工具,promote_tool 能把驗(yàn)證過的工具保留到跨會(huì)話。一次任務(wù)里造的工具,下一次任務(wù)還在,模型由此可以逐步攢出一套屬于自己的工具箱,而不是每次都從零開始。
![]()
函數(shù)調(diào)用方法 vs REPL:函數(shù)調(diào)用通過模型返回每個(gè)中間值,而 REPL 則將依賴的計(jì)算保留在單一可執(zhí)行狀態(tài)內(nèi)。
第三個(gè)是HCP。這個(gè)配置標(biāo)準(zhǔn)可把不同 agent harness 用到的各種復(fù)雜設(shè)置(AGENTS.md 文件、skills、hooks、系統(tǒng)指令、模型提供方配置等)收攏成了統(tǒng)一格式,使 agent 會(huì)話的配置與優(yōu)化更容易標(biāo)準(zhǔn)化、遷移,并在訓(xùn)練與生產(chǎn)環(huán)境之間保持一致。正如前文所說,它也是 MindForge 遞歸自我改進(jìn)閉環(huán)的關(guān)鍵一環(huán)。
結(jié)語
Mind Lab 已將旗艦?zāi)P?strong>Macaron-V1-Venti、把編程基座合并進(jìn)來的Macaron-V1-Coding-Venti、基于 Qwen 3.6 35B 的小號模型Macaron-V1-Tall三個(gè)變體的開放權(quán)重發(fā)布在 Hugging Face:
https://huggingface.co/collections/mindlab-research/macaron-v1
官方托管 API 同日上線,是嘗試 Venti 的最快路徑。另還有一個(gè)叫Macaron Artifacts的插件,可用于可視化 UI4A 的輸出:
- 海外:https://mint.macaron.im
- 中國大陸:https://mintcn.macaron.xin
- Macaron Artifacts:https://github.com/MindLab-Research/macaron-artifacts
訓(xùn)練結(jié)束,不該是學(xué)習(xí)結(jié)束。Macaron-V1 已經(jīng)給出了一個(gè)初步答案。
但經(jīng)驗(yàn)智能機(jī)器仍然是一個(gè)長期目標(biāo),前面還橫著幾個(gè)沒解決的核心問題:反饋往往延遲、模糊、難以歸因,模型的自我反思仍可能錯(cuò)誤歸因和自我合理化;學(xué)習(xí)本身還不夠高效;持續(xù)更新的穩(wěn)定性問題……
但 Mind Lab 已經(jīng)把經(jīng)驗(yàn)智能推進(jìn)到了可下載、可自托管、可復(fù)現(xiàn)的地步:在一個(gè)足夠強(qiáng)的開源基座之上,用可插拔的 LoRA 承載持續(xù)學(xué)習(xí),用多個(gè) LoRA 的協(xié)作實(shí)現(xiàn)群體智能,再用一套能同時(shí)駕馭百萬 Adapter 的基礎(chǔ)設(shè)施把它們撐起來。
未來的經(jīng)驗(yàn)智能機(jī)器,越來越值得期待了……
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.