![]()
作者|黃小藝
微信|H997Hbiu
一個(gè)應(yīng)用公司,突然宣布成立 AI Lab,一般有兩種結(jié)果。
一種是換個(gè)名字、攢幾篇 Blog,拿到新的投資,但繼續(xù)做原來(lái)的事兒。
一種是找來(lái)訓(xùn)練模型的人,組成新的業(yè)務(wù)架構(gòu),真的去嘗試一些實(shí)驗(yàn)性的激進(jìn)的前沿技術(shù)路線。
Mind Lab 看起來(lái)屬于第二種。
2025 年底,個(gè)人 Agent Macaron 背后的 AI 公司 Mindverse 宣布成立 Mind Lab,并把它定義成一家 Neo Lab。很多人的第一反應(yīng)是:怎么Agent 產(chǎn)品公司也要做前沿實(shí)驗(yàn)室了?
7 月 22 日,Mind Lab 正式發(fā)布并開(kāi)源 Macaron V1,第一次正面回答了這個(gè)問(wèn)題。
Macaron V1 包括兩個(gè)版本:旗艦版 Venti(748B)和面向本地部署的 Tall(50B)。其中,Venti 有744B參數(shù)來(lái)自于GLM-5.2 ,自己訓(xùn)練的只有 4B——四組各約 1B 的 LoRA,分別優(yōu)化 Chat、Agent、Coding 和 UI。
也就是說(shuō),99.47% 的參數(shù)已經(jīng)在那里,Mind Lab 只動(dòng)了剩下的 0.53%。
但就是這小小的4B,根據(jù) Mind Lab 公布的結(jié)果,讓 Macaron V1-Venti 在12項(xiàng)評(píng)測(cè)里全部超過(guò)了原始 GLM-5.2,其中7項(xiàng)同時(shí)超過(guò) GPT-5.5 和 Claude Opus 4.8,包括 TerminalBench 2.1、PinchBench等。
![]()
這個(gè)跑分效果想要說(shuō)明的是,小參數(shù)LoRA也能帶來(lái)前沿模型的性能提升,它也在驗(yàn)證另一件事:模型在發(fā)布后,還能通過(guò)一組組輕量參數(shù)的后訓(xùn)練,持續(xù)提升效果。
這剛好撞上了一個(gè)突然變熱的行業(yè)問(wèn)題:模型如何在進(jìn)入真實(shí)世界后持續(xù)學(xué)習(xí)?
雖然這個(gè)話題被提出很久了,但最近,梁文鋒把“持續(xù)學(xué)習(xí)”稱為繼Agent 之后,模型需要突破的下一個(gè)問(wèn)題;Thinking Machines Lab 則用 Inkling 和 Tinker 演示了模型“自己訓(xùn)練自己”并切換新權(quán)重的過(guò)程,讓很多人聯(lián)想到了它在持續(xù)學(xué)習(xí)領(lǐng)域的潛力。
Mind Lab 想做的也是這件事。V1 的背后,Mind Lab 把 MoL(Mixture-of-LoRA)、近萬(wàn)億參數(shù)模型上的后訓(xùn)練、遞歸自我改進(jìn)和多智能體協(xié)作這些仍帶著實(shí)驗(yàn)色彩的要素,組合在了一起。
1
實(shí)測(cè):從交互設(shè)計(jì)到本地執(zhí)行
在介紹他們?cè)诩夹g(shù)上做了哪些有意思的工作前,我們先把玩了一下這個(gè)模型。
我們通過(guò) API 給 Macaron V1 -Venti 準(zhǔn)備了三項(xiàng)開(kāi)放測(cè)試,分別觀察它的 UI4A、前端實(shí)現(xiàn)和 Agent 能力,一個(gè)核心的感受就是,它執(zhí)行任務(wù)的完整度很高,時(shí)間和步驟很長(zhǎng)。
實(shí)測(cè)一:把一段“吃瓜群聊”變成可以玩的界面
第一項(xiàng)測(cè)試中,我們讓 V1 模擬一個(gè)有些詭異的群聊:幾個(gè)人表面上聊辦公室八卦,實(shí)際上在生活閑扯里交換暗號(hào),并把整段對(duì)話做成 UI4A 界面。
V1 基本理解了“明里吃瓜、暗里對(duì)暗號(hào)”的雙層敘事。它設(shè)計(jì)了五個(gè)群聊成員:有人負(fù)責(zé)夸張起哄,有人不斷追問(wèn),有人只說(shuō)極短的指令。明面上的話題是新同事保溫杯里泡了什么,另一層則把時(shí)間、人數(shù)和行動(dòng)安排藏進(jìn)這些閑聊中。
它還給頁(yè)面增加了一個(gè)“解密”按鈕。普通狀態(tài)下,用戶看到的是一段節(jié)奏很快的辦公室群聊;點(diǎn)開(kāi)解密后,與暗號(hào)有關(guān)的消息會(huì)被重新標(biāo)注,并顯示對(duì)應(yīng)解釋。
![]()
原本只能從頭讀到尾的一段文字,因此變成了一個(gè)交互小品,游戲趣味性很強(qiáng)。
但不足之處是,解密對(duì)話的設(shè)計(jì)不夠精巧,比如“今晚八點(diǎn),老地方”“三個(gè),都穿黑”,并沒(méi)有真正藏進(jìn)生活閑聊。
實(shí)測(cè)二:完成一個(gè)餐廳官網(wǎng)
我們只給出餐廳名 FENNEL,以及“現(xiàn)代小酒館”的定位,要求模型做一個(gè)官網(wǎng)頁(yè)面,包含餐廳介紹、四類菜單、標(biāo)簽篩選、菜品詳情和訂位流程。
結(jié)果是 V1 對(duì)主題的理解相當(dāng)?shù)轿唬鼜?FENNEL 這個(gè)名字出發(fā),把茴香和植物線稿變成貫穿頁(yè)面的視覺(jué)元素,菜單則圍繞現(xiàn)代歐洲小酒館展開(kāi),使用大幅留白、精細(xì)分隔線和克制的酒紅色按鈕。
頁(yè)面的交互邏輯也完全成立,用戶可以按素食、無(wú)麩質(zhì)和辛辣篩選菜品,點(diǎn)擊菜名后在側(cè)邊卡片查看配料和推薦酒款;訂位部分則完整走通了日期、人數(shù)、時(shí)間、姓名和電話的流程。
![]()
但最致命的問(wèn)題在于,菜單把一道含有北非粗麥粉的菜品標(biāo)成了“無(wú)麩質(zhì)”,沒(méi)有在交付之前完整地自檢文本。
實(shí)測(cè)三:在本地渲染一艘未來(lái)深海潛艇
第三個(gè)測(cè)試,我們要求 V1 使用 Blender 制作一艘高級(jí)質(zhì)感的未來(lái)深海科研潛艇, PBR 材質(zhì)、體積光、粒子和景深,并交付 Blender 工程與最終渲染圖。
![]()
單看最終效果,這個(gè)案例的完成度不錯(cuò):深色背景、藍(lán)綠色設(shè)備燈和暖色舷窗、船體、推進(jìn)器和外部設(shè)備,有明顯的電影概念圖質(zhì)感。
整個(gè)任務(wù)運(yùn)行了近40分鐘,經(jīng)歷了腳本調(diào)試和多輪測(cè)試渲染。最終交付給到了一份能繼續(xù)編輯的 Blender 工程和生成腳本。
這里體現(xiàn)出的能力,是模型能夠圍繞一個(gè)目標(biāo)持續(xù)操作本地環(huán)境,在編寫代碼、運(yùn)行程序、查看結(jié)果和再次修改之間保持任務(wù)連續(xù)性。
需要說(shuō)明的是,我們沒(méi)有使用原始 GLM-5.2 復(fù)跑同一組任務(wù),因此這三項(xiàng)測(cè)試不能被視為一組嚴(yán)格的 LoRA 增益對(duì)照。
但它們至少呈現(xiàn)了 Macaron V1 的能力取向:它擅長(zhǎng)把基座已有的文本、代碼、工具和視覺(jué)能力組織成一條可以交付的行動(dòng)鏈。
1
744B 負(fù)責(zé)能力,4B 負(fù)責(zé)把能力用對(duì)
要理解這種能力從哪里來(lái),就需要回到 Mind Lab 真正訓(xùn)練的 4B 參數(shù)。
這 4B 參數(shù)采用的 LoRA 技術(shù),在 2021 年就已經(jīng)被提出,后來(lái)又因?yàn)?Stable Diffusion 的風(fēng)格訓(xùn)練被更多人認(rèn)識(shí)。
它通過(guò)在訓(xùn)練時(shí)凍結(jié)基座權(quán)重,只在部分網(wǎng)絡(luò)層旁加入小規(guī)模可訓(xùn)練矩陣,用一筆增量修正模型輸出。因此,過(guò)去它更多被視為全參數(shù)后訓(xùn)練的平替方案。
但Mind Lab 想證明的是,它還可以成為前沿模型的正式組成部分。
在Macaron V1 Venti 中,Mind Lab 凍結(jié)了 GLM-5.2 的基礎(chǔ)權(quán)重,并在其上分別訓(xùn)練了四個(gè)約 1B 參數(shù)的 LoRA 專家,面向 Chat、Agent、Coding 和 UI 四類能力,這套架構(gòu)稱為 MoL(Mixture of LoRA)。
![]()
這么做是因?yàn)楹笥?xùn)練里的能力并不總能和平共處。
聊天需要自然、連貫,Coding 要求精確、克制;Agent 需要持續(xù)調(diào)用工具,UI 又要求模型同時(shí)理解內(nèi)容、代碼和交互協(xié)議。如果所有目標(biāo)都在一組參數(shù)里反復(fù)拉扯,一種能力提升,另一種可能就在退化。
MoL 的辦法很直接:既然訓(xùn)練目標(biāo)不同,那就分開(kāi)練。需要新能力時(shí),不必重新合并整臺(tái)模型,再掛一組 LoRA 就行。
官方評(píng)測(cè)結(jié)果展示了Macaron V1中,多個(gè)LoRA對(duì)不同場(chǎng)景的匹配。
以TerminalBench為例,由于GLM-5.2 已經(jīng)掌握了代碼、命令和工具調(diào)用,LoRA 只需要把模型偶爾做對(duì)的操作變得更加穩(wěn)定,就能獲得明顯的提升。
但到了SWE Atlas QnA 的測(cè)試中,由于它要求 Agent 進(jìn)入真實(shí)工程倉(cāng)庫(kù),通過(guò)代碼搜索、運(yùn)行時(shí)分析和跨文件推理回答架構(gòu)問(wèn)題,基礎(chǔ)模型很難通過(guò)一組1B參數(shù)迅速補(bǔ)齊,最終這一項(xiàng)只提高了0.6分。
這些結(jié)果把 LoRA 的能力邊界說(shuō)得很清楚:它更擅長(zhǎng)改變模型調(diào)用已有能力的方式,補(bǔ)充基座的短板則要困難得多。
先有足夠強(qiáng)的 744B,才有值得訓(xùn)練的 4B LoRA。
1
模型發(fā)布以后,“經(jīng)驗(yàn)”還要繼續(xù)進(jìn)入?yún)?shù)
既然 LoRA 這么好用,為什么長(zhǎng)期以來(lái),它在很多人眼中只是平替,直到當(dāng)下這個(gè)節(jié)點(diǎn)?
一個(gè)原因是它要求基礎(chǔ)模型本身有相當(dāng)高的智能水平;另一個(gè)原因,和Agent的廣泛使用有關(guān)。
Agent 長(zhǎng)期進(jìn)入工作和生活后,會(huì)反復(fù)操作同一套工具、閱讀同一個(gè)代碼庫(kù),也會(huì)不斷犯錯(cuò)并接受糾正。這些預(yù)訓(xùn)練無(wú)法提前獲得的經(jīng)驗(yàn)信息,會(huì)直接影響它下一次能否完成任務(wù)。
常見(jiàn)處理方式是把這些信息寫進(jìn) Memory、Skill、知識(shí)庫(kù)或者系統(tǒng)提示詞,需要時(shí)重新放回上下文,但這仍然屬于外部存儲(chǔ)和調(diào)用,等到下一次推理時(shí),系統(tǒng)需要重新檢索、拼接和讀取這些材料,也會(huì)繼續(xù)消耗上下文。
而參數(shù)訓(xùn)練帶來(lái)的改變不一樣。
一段經(jīng)驗(yàn)如果被寫進(jìn)了參數(shù),即使 Prompt 里沒(méi)有再提起它,模型的行為傾向也會(huì)改變。這是“記住”和“每次都被提醒”的區(qū)別。
考慮到全參數(shù)訓(xùn)練的成本擺在那,不可能為每個(gè)用戶、每個(gè)代碼庫(kù)、每個(gè) Agent 分別訓(xùn)一遍 744B 模型,這個(gè)時(shí)候,LoRA就為這些經(jīng)驗(yàn)與習(xí)慣類的信息,提供了一條中間路徑:成本足夠低,可以單獨(dú)訓(xùn)練、保存、加載、評(píng)測(cè)和回滾,同時(shí)直接參與模型內(nèi)部計(jì)算。
當(dāng)然,Macaron V1 目前交付的四組 LoRA 仍然屬于通用能力模塊,覆蓋 Chat、Agent、Coding 和 UI。 Mind Lab下一步想推進(jìn)的,才是為每個(gè)用戶在線訓(xùn)練一組個(gè)人 LoRA。
但V1 給出了它的第一步驗(yàn)證:在強(qiáng)基座上的少量參數(shù)更新,可以獲得穩(wěn)定收益。
1
為L(zhǎng)oRA的持續(xù)迭代,搭一套后訓(xùn)練“系統(tǒng)”
如果要進(jìn)化到為“一戶一LoRA”,那么 Mind Lab 必須擁有一套自己的、完善的、穩(wěn)定的后訓(xùn)練系統(tǒng)。
V1 的背后,就有這樣一套系統(tǒng)。
在 V1 中,只訓(xùn)練 0.53% 參數(shù),很容易讓人誤以為這件事的工程量也只有 0.53%。
實(shí)際完全不是。LoRA 省掉的是基座權(quán)重的梯度和優(yōu)化器狀態(tài),但 744B 模型本身仍然要完整運(yùn)行。每生成一次答案、計(jì)算一次獎(jiǎng)勵(lì)、更新一次參數(shù),數(shù)據(jù)都要穿過(guò)整臺(tái)模型。
Agent的長(zhǎng)軌跡和模型的 MoE 架構(gòu)還帶來(lái)了額外壓力:前者讓激活保存與反向傳播占用大量顯存;后者可能因?yàn)橥评砗陀?xùn)練階段的實(shí)現(xiàn)或數(shù)值精度不同,使同一個(gè) token 在兩次計(jì)算中被分配給不同專家,這樣一來(lái),訓(xùn)練時(shí)重算的概率就不再對(duì)應(yīng)實(shí)際生成軌跡,策略梯度也會(huì)失真。
Mind Lab 過(guò)去八個(gè)月的大部分工作,其實(shí)都在解決這些問(wèn)題。
2025 年 12 月,Mind Lab 先在 Kimi K2 上完成萬(wàn)億參數(shù) LoRA-RL 實(shí)驗(yàn),使用的 GPU 數(shù)量約為傳統(tǒng)全參數(shù) RL 的 10%;2026 年 1 月發(fā)布 MinT,把計(jì)算調(diào)度、分布式訓(xùn)練、模型狀態(tài)和故障恢復(fù)封裝成后訓(xùn)練基礎(chǔ)設(shè)施; 2 月提出 Context Learning,研究哪些上下文經(jīng)驗(yàn)值得進(jìn)入?yún)?shù);4 月完成 GLM-5 和 GLM-5.1 的 LoRA 訓(xùn)練、DSA 與 MTP 適配;6 月發(fā)布 Macaron V1 Preview;7 月連續(xù)公開(kāi)了 LongStraw、UI4A 等長(zhǎng)上下文 RL 和生成式界面工作。
![]()
這些看起來(lái)相對(duì)分散的項(xiàng)目,最后在 Macaron V1 上匯合了。
MinT 管理訓(xùn)練、評(píng)測(cè)、服務(wù)和回滾;LongStraw 解決百萬(wàn) token 級(jí)長(zhǎng)上下文 RL 的執(zhí)行問(wèn)題;R3 對(duì)齊生成和訓(xùn)練時(shí)的 MoE 專家路由;MindForge 則把生產(chǎn)環(huán)境使用的 Agent Harness 帶進(jìn)強(qiáng)化學(xué)習(xí),盡量避免模型訓(xùn)練一套、部署以后又換成另一套。
這是一項(xiàng)龐大的系統(tǒng)工程。
1
更新模型的能力,正在成為產(chǎn)品
不止Mind Lab,Thinking Machines Lab 也在探索相似方向。
它推出的 Tinker 是一套 LoRA 訓(xùn)練 API。開(kāi)發(fā)者決定數(shù)據(jù)、獎(jiǎng)勵(lì)和訓(xùn)練循環(huán),平臺(tái)負(fù)責(zé)算力與分布式系統(tǒng)。不同的是,TML 首先面向外部研究者和開(kāi)發(fā)者提供通用訓(xùn)練基礎(chǔ)設(shè)施,Mind Lab 則同時(shí)運(yùn)營(yíng) Macaron Agent,并嘗試把 Agent 在真實(shí)產(chǎn)品中產(chǎn)生的任務(wù)軌跡和用戶反饋帶回訓(xùn)練循環(huán)。
兩家公司從不同位置出發(fā),得出了相近判斷:越來(lái)越強(qiáng)的基礎(chǔ)模型會(huì)成為起點(diǎn),模型發(fā)布后的更新能力會(huì)形成新的競(jìng)爭(zhēng)層。
這條路線仍有很多問(wèn)題需要解決。現(xiàn)實(shí)反饋經(jīng)常延遲、模糊甚至互相沖突,模型也可能把偶然偏好寫成長(zhǎng)期習(xí)慣。哪些信息可以進(jìn)入?yún)?shù),誰(shuí)擁有刪除權(quán)限,模型學(xué)壞以后怎樣恢復(fù),都需要長(zhǎng)期研究和產(chǎn)品驗(yàn)證。
面向每個(gè)用戶的持續(xù)在線學(xué)習(xí)仍處于未來(lái)階段。但V1的價(jià)值在于,把Mind Lab自己所相信的這條技術(shù)路線推進(jìn)成了一套可以訓(xùn)練、評(píng)測(cè)和運(yùn)行的工程系統(tǒng)。
如果基礎(chǔ)模型會(huì)逐漸成為基礎(chǔ)設(shè)施,那么安全、便宜、持續(xù)地修改這些模型,會(huì)成為一項(xiàng)獨(dú)立且重要的能力。
而Mind Lab 想要制造出這種能力。
![]()
點(diǎn)個(gè)“愛(ài)心”,再走 吧
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.