![]()
![]()
編輯:前沿在線 編輯部
7 月 19 日上午,面壁智能主辦的「智在終端 惠及千行」分論壇在世界人工智能大會上圓滿舉行。
論壇上,面壁智能聯(lián)合 OpenBMB 正式發(fā)布并開源了其首個具身智能技術(shù)成果 MiniCPM-Robot 系列模型,「小鋼炮」正式進(jìn)軍機器人領(lǐng)域!
本次發(fā)布的 MiniCPM-Robot 系列成果包括兩個具身智能模型:通用 VLA 模型MiniCPM-RobotManip,與面向移動機器人跟蹤導(dǎo)航的MiniCPM-RobotTrack。
MiniCPM-RobotManip 基于面壁智能最新多模態(tài)端側(cè)模型 MiniCPM-V 4.6 訓(xùn)練完成,延續(xù)了 MiniCPM-V 4.6 「小尺寸、高性能」與視覺 Token 極致壓縮的技術(shù)優(yōu)勢,以僅 1.5B 的參數(shù)規(guī)模實現(xiàn)比肩體量更大的3-4B模型的性能、但流式實時推理計算成本減半,模型支持1分鐘的具身原生記憶,從而能夠高效完成考驗上下文記憶的操作任務(wù)。
圖注:MiniCPM-RobotManip 在真機上完成三明治制作(5倍速)
MiniCPM-RobotTrack 由面壁智能和南京大學(xué)合作研發(fā),是業(yè)內(nèi)首個支持真實本地斷網(wǎng)部署的跟蹤(Tracking)模型,首次實現(xiàn)純視覺的本地自主指令追蹤。
模型原生適配宇樹 Go2 Edu ,僅依靠原裝攝像頭和本地算力即可完成單目標(biāo)、動態(tài)多目標(biāo)及模糊目標(biāo)跟蹤,穩(wěn)定達(dá)到 5+ Hz,端到端響應(yīng)時延約 180 毫秒,并構(gòu)建了自進(jìn)化數(shù)據(jù)管線、能夠持續(xù)提升復(fù)雜動態(tài)環(huán)境下的跟蹤能力。
圖注:搭載 MiniCPM-RobotTrack 的機器狗可以在開放環(huán)境下零樣本指令跟隨,并且抗各類人物穿梭干擾,同時可以在無網(wǎng)/弱網(wǎng)環(huán)境(電梯/停車場)下流暢跟隨
目前,MiniCPM-Robot 系列模型均已開源,歡迎開發(fā)者與具身智能從業(yè)者下載部署并試用:
GitHub 鏈接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face 鏈接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
![]()
通用 VLA:MiniCPM-RobotManip
MiniCPM-RobotManip 是一款面向機器人操作的 1.5B 通用 VLA 模型,保留了面壁智能多模態(tài)基礎(chǔ)模型 MiniCPM-V 4.6 的通用理解能力,并基于多任務(wù)進(jìn)行統(tǒng)一訓(xùn)練,讓同一模型學(xué)習(xí)處理不同指令和操作任務(wù)。
根據(jù)主流 VLA 基準(zhǔn)測試,MiniCPM-RobotManip 的綜合性能位列 VLA 模型的第一梯隊,與 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表現(xiàn)。
![]()
尤其是在考驗 VLA 模型上下文記憶的 RMBench 上,MiniCPM-RobotManip 更是明顯超越多個主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近隨機的水平。
如下圖,模型可以先蓋住不同顏色方塊后 ,以紅綠藍(lán)順序揭開,體現(xiàn)其原生上下文能力,當(dāng)前主流基于單幀反應(yīng)式的VLA是做不到的。
圖注:MiniCPM-RobotManip具有原生記憶能力 (8倍速)
MiniCPM-RobotManip 將 MiniCPM-V 4.6 的視覺 Token 高效壓縮優(yōu)勢進(jìn)一步應(yīng)用于機器人場景,大幅降低了機器人的視覺輸入計算量與推理時延,使機器人在保留1分鐘上下文記憶后的推理成本與傳統(tǒng)單幀反應(yīng)式的推理成本相當(dāng)——換言之,模型性能更優(yōu)、部署成本卻更低。
根據(jù)測試,在包含60 幀歷史觀測的機器人操作任務(wù)中,傳統(tǒng)重新計算方式每個決策步需要125 TFLOPs,采用流式推理后僅需3.3 TFLOPs,低于 π0.5 在無歷史幀輸入下的5.0 TFLOPs。
在 H100、BF16 精度下,MiniCPM-RobotManip 單決策步推理時延為120ms,相比 π0.5 的 234ms 降低近一半,實現(xiàn)了上下文記憶與響應(yīng)效率的兼顧。
![]()
![]()
![]()
首個本地斷網(wǎng)部署跟蹤模型:MiniCPM-RobotTrack
MiniCPM-RobotTrack 是一款 0.9B 端到端視覺指令跟蹤模型,具有以下三個技術(shù)優(yōu)勢:
三項跟蹤任務(wù)領(lǐng)跑開源 SOTA
我們從單目標(biāo)跟蹤(STT)、動態(tài)多目標(biāo)跟蹤(DT)和模糊目標(biāo)跟蹤(AT)三類典型場景維度對 MiniCPM-RobotTrack 進(jìn)行了評測。
在僅有0.9B參數(shù)且未進(jìn)行下游強化學(xué)習(xí)優(yōu)化的情況下,MiniCPM-RobotTrack 在三項任務(wù)中的追蹤率分別達(dá)到89.8、73.4 和 80.4,取得開源方案最優(yōu)結(jié)果,相比 OmTrackVLA 分別提升7.0、14.6 和 6.5 個百分點。
在相同的單視角、純 SFT(監(jiān)督微調(diào)訓(xùn)練)設(shè)定下,與其他閉源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在單目標(biāo)跟蹤和模糊目標(biāo)跟蹤任務(wù)上的追蹤率分別提升 8.8 和 17.0 個百分點,模糊目標(biāo)跟蹤任務(wù)的成功率達(dá)到 58.0%。這表明,通過高質(zhì)量數(shù)據(jù)和端到端訓(xùn)練,輕量級模型無需依賴多視角輸入或下游 RL,也能獲得具有競爭力的真實場景指令追蹤能力。
![]()
自進(jìn)化數(shù)據(jù)管線,讓模型在實踐中越用越強
針對真機數(shù)據(jù)采集成本高、長尾場景覆蓋有限等問題,MiniCPM-RobotTrack 構(gòu)建了自進(jìn)化數(shù)據(jù)管線,先通過自動檢測與人工復(fù)核清洗異常軌跡、錯誤動作等低質(zhì)量數(shù)據(jù),再引入面向具身追蹤的 DAgger 策略,讓模型在仿真與真機交互中主動暴露薄弱環(huán)節(jié),針對快速轉(zhuǎn)向、短時遮擋、多人交叉等復(fù)雜場景持續(xù)補充高價值樣本,在數(shù)據(jù)閉環(huán)中提升跟蹤與泛化能力。
真機實測5+Hz,斷網(wǎng)也能自主跟蹤
經(jīng)過對宇樹 Unitree Go2 完整運行鏈路的系統(tǒng)性優(yōu)化,MiniCPM-RobotTrack模型在機器狗原生本地算力下穩(wěn)定達(dá)到5+ Hz,端到端響應(yīng)時延約180 毫秒。
在真機 Demo 中,即使現(xiàn)場拔掉網(wǎng)卡,機器狗仍能依靠本地視覺畫面與文本指令持續(xù)完成目標(biāo)識別、跟蹤與運動控制。
該能力可應(yīng)用于樓宇巡檢、人員陪護(hù)和園區(qū)安防,未來有望拓展至災(zāi)害救援、特種作業(yè)等弱網(wǎng)、斷網(wǎng)或強干擾場景。
本次開源還將提供完整部署流程與一鍵啟動腳本,覆蓋模型加載、攝像頭接入、文本指令輸入和機器人控制接口,真正實現(xiàn)純本地部署、開箱即用。
![]()
具身智能推理框架:PhyAI
此次發(fā)布的兩款模型均獲得了PhyAI的推理支持。
PhyAI 是一款面向 Physical AI 的開源推理框架,專為端側(cè)極速推理與云端 RL 大規(guī)模 Rollout 場景設(shè)計。
與模型官方倉庫相比,PhyAI 在 NVIDIA GeForce RTX 5090 上運行 π0、π0.5 和 GR00T 時,分別實現(xiàn)了約2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分別實現(xiàn)約1.40 倍和 4.31 倍加速。
面對 VLA、WAM 等模型結(jié)構(gòu)快速演進(jìn)、架構(gòu)差異顯著的現(xiàn)狀,PhyAI 將易用性與靈活性置于首位,致力于降低模型從研究原型走向高效推理的適配成本。
通過簡潔的 API,PhyAI 在發(fā)布首日即完成了對 MiniCPMRobot 的適配支持,并使用 CUDA Graph 進(jìn)行加速,推理幀率從 10.12 Hz 提升至 33.28 Hz,同時還采取了算子融合的方法,使用triton編寫了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等為 MiniCPMRobot 定制的融合算子,減少中間變量的搬運次數(shù),將其在 NVIDIA H20 上的推理幀率進(jìn)一步提升至 36.77 Hz。
![]()
讓端側(cè) AI 走進(jìn)千行萬業(yè)
在推進(jìn)開源技術(shù)的同時,我們也在與產(chǎn)業(yè)伙伴共同探索真實場景應(yīng)用。
目前,面壁智能已經(jīng)與樂聚機器人合作推出展廳導(dǎo)覽和園區(qū)巡檢 Agent 解決方案,并與吉利汽車圍繞 VLA 模型、生產(chǎn)倉儲應(yīng)用等方向展開合作,推動具身智能技術(shù)在實際環(huán)境中持續(xù)驗證和迭代。
對面壁智能而言,探索物理 AGI 與長期追尋的 AGI 目標(biāo)一脈相承。
隨著機器人逐步進(jìn)入家庭、辦公和工廠,本地感知、推理與決策將成為保障實時性、穩(wěn)定性和數(shù)據(jù)隱私的重要方向。
未來,我們將繼續(xù)投入具身領(lǐng)域,堅持通過開源與產(chǎn)業(yè)合作推動模型在真實場景中持續(xù)驗證,讓物理智能更加可靠、安全地走進(jìn)現(xiàn)實世界。
![]()
前沿動態(tài)前沿大會
前沿人物
點「在看」,給前前加雞腿
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.