![]()
智東西
作者 ZeR0
編輯 漠影
智東西7月23日報道,在世界人工智能大會WAIC 2026期間,北京大模型獨角獸面壁智能開源了其首個具身智能技術成果MiniCPM-Robot系列模型,包括通用VLA模型MiniCPM-RobotManip與面向移動機器人跟蹤導航的MiniCPM-RobotTrack,正式進軍機器人領域。
面壁智能成立于2022年8月,今年上半年累計融資超過50億元,估值超過200億元,是當前我國端側智能領域公開估值最大的獨角獸企業。
MiniCPM-RobotManip基于面壁智能最新多模態端側模型MiniCPM-V 4.6訓練完成,延續了MiniCPM-V 4.6“小尺寸、高性能”與視覺Token極致壓縮的技術優勢,以僅1.5B的參數規模實現比肩體量更大的3-4B模型的性能、但流式實時推理計算成本減半,模型支持1分鐘的具身原生記憶,從而能夠高效完成考驗上下文記憶的操作任務。
![]()
MiniCPM-RobotTrack由面壁智能和南京大學合作研發,是業內首個支持真實本地斷網部署的跟蹤模型,首次實現純視覺的本地自主指令追蹤。
該模型原生適配宇樹Go2 Edu ,僅依靠原裝攝像頭和本地算力即可完成單目標、動態多目標及模糊目標跟蹤,穩定達到5+ Hz,端到端響應時延約180毫秒,并構建了自進化數據管線、能夠持續提升復雜動態環境下的跟蹤能力。
![]()
GitHub地址:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face地址:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
截至2026年6月30日,面壁智能MiniCPM開源模型系列累計下載量突破3800萬次,覆蓋文本、視覺、語音全模態。
在具身智能領域,面壁智能與吉利汽車、樂聚機器人開展深度合作,形成面向工業制造與商業服務的雙線布局。
在工業制造方向,面壁智能的VLM多模態大模型與吉利機器人的本體、VLA模型及導航系統深度集成,成功實現吉利機器人在生產倉儲場景的落地應用。
在商業服務方向,面壁智能與樂聚機器人聯合推出展廳導覽Agent解決方案,可在無網絡環境下純端側運行導覽系統,支持基于本地知識庫的離線講解和自由問答。
在巡檢場景中,依托面壁智能的多模態能力,搭載樂聚機器人本體和巡檢系統,可高效識別園區內車輛違規停放、路面異常、公共設施異常等情況,所有敏感數據均在本地處理。該方案覆蓋6大類商用導覽場景,可識別30余種巡檢異常,檢測成功率超過95% 。
WAIC期間,面壁智能創始人兼首席科學家劉知遠、面壁智能多模態智能首席科學家姚遠與智東西等媒體進行交流,進一步分享了面壁智能做具身智能的動力、優勢、打法與目標。
一、為什么要做具身智能?目標與技術積累雙重驅動
劉知遠認為,具身智能是AI走向物理世界的必由之路,面壁智能內部團隊的共同目標是端側智能,機器人是下一代智能終端非常重要的形態。
從技術角度而言,具身智能屬于多模態的直接下游,面壁智能在高效多模態路線上有很多技術積累,這也是為什么面壁智能做具身智能時間不長,但基礎工程鏈路認知建立得較快。
語言模型具備思考、決策、規劃能力;過去三年,姚遠在面壁智能補齊了感知能力,有了更多的模態,如語音、視覺,未來可能還有雷達、遙感等各種來自自然界的信號;具身智能則補齊了動作、行動能力。人類智能包括感知、思考和行動,未來要形成一個嚴格閉環,這就是面壁智能團隊在努力完成的工作。
據姚遠透露,面壁智能的語言模型、多模態模型、具身智能模型團隊相互支撐,底層數據、工程鏈都是共享的,具身智能團隊訓的VLA模型是直接基于多模態團隊的工作,很多通用能力能快速拉到一起做,因此能在較短時間內達到相對第一梯隊的效果。
![]()
“具身智能模型連ChatGPT時刻還沒有找到。”劉知遠說。在他看來,大語言模型、感知、行動成熟度不同,語言模型聚焦在讓密度持續變高,多模態要補足最后幾個拼圖,讓它達到完全態,然后再進一步的追求密度,讓它反應更快;行動成熟度還沒有那么高,更多還是在做探索性的工作,技術成熟后才有可能商業化。
數據是當前具身智能行業面臨的共同瓶頸。姚遠說,沒有一種數據是完美的,要么是量不夠,要么是精度不夠。真實世界的一大難點來自多樣性、隨機性,無法通過少數幾條過擬合去解決的。面壁智能將具身智能模型和多模態模型底層數據打通,同時也會有各種類型的具身智能數據。
在劉知遠看來,具身智能的數據不是能從互聯網獲取的,要有意識地從自然界的交互反饋中去收集,把感知、思考和行動形成一個閉環。現在越來越多的具身智能企業將主要精力放在數據集的構建上,這會極大加速具身智能的進展。
二、具身智能發揮大腦角色,要走先通后專模式
面壁智能的具身智能模型以通用智能為起點,旨在讓機器人能夠直接處理普適、長程、流水線式任務。
據劉知遠分享,面壁智能的具身智能模型發揮“大腦”角色,會與很多不同類型的本體廠商合作,包括做人形機器人、機器狗、靈巧手、機械臂的,通過大小腦協同等方式工作。
相比之下,一些本體廠商更適合做本體上的“小腦”,偏具體行動,可能會涉及感知,不太涉及思考。感知與行動要形成一個快速閉環,不需要經過大腦。
面壁智能做的是通用具身智能。它在語言模型和多模態模型上看到的一個重要趨勢,是基礎能力上來后,很多場景就會迎刃而解。
劉知遠解釋說,大語言模型是“先通后專”,先具備通用能力,也就是關于這個世界的常識,再把它培養為相關領域的專家,這樣專家水平的上限才會更高。
他預測,未來3到5年,具身智能同樣要走“先通后專”的模式。
“通用”意味著能在廣闊場景里廣泛應用,比如Anthropic Claude擅長的編程專業能力,是基于大語言模型做的。
好比它首先是一個非常聰明的大學生,再讓它變成一個很聰明的程序員。如果只是用代碼訓這個模型,達不到現在的效果。
就像一位學者曾說過的,你的目標是登月,但如果你以爬樹的形式來嘗試著離月亮更近,你是永遠不可能到月亮上去的。
姚遠談道,很多模型為了展示出好的效果,會針對專門任務、專門場景去訓練一個專家模型,提前可能會采集該任務的很多數據,這樣做出一段demo還是相對簡單的。但這不代表該領域發展的進度,目前具身智能基礎模型的基礎性、泛化性、通用性仍存在很大問題。
面壁智能并沒有對某一個場景做特別深度的優化,希望先把基礎的數據、 Infra工程鏈路打磨好,實現較好的泛化基礎。
三、兼顧上下文記憶與響應效率,單決策步推理時延遠低于π0.5
面壁智能的通用VLA具身模型MiniCPM-RobotManip融合多模態技術沉淀與視覺Token極致壓縮能力,保留完整歷史觀測記憶的同時,計算量與不保留記憶時持平,在考驗VLA模型上下文記憶的基準測試RMBench上取得顯著優勢。
根據測試,在包含60幀歷史觀測的機器人操作任務中,傳統重新計算方式每個決策步需要125TFLOPS,采用流式推理后僅需3.3TFLOPS,低于π0.5在無歷史幀輸入下的5.0TFLOPS。在H100、BF16精度下,MiniCPM-RobotManip單決策步推理時延為120ms,相比π0.5的234ms降低近一半,實現了上下文記憶與響應效率的兼顧。
![]()
當前上下文記憶難在哪兒?姚遠談道,現在的視覺是三路甚至四路的,每秒保持一幀,要支持一分鐘的原生,大概是幾百幀圖片、幾萬個Token甚至高達十萬個Token的長度,要求模型有極致的視覺Token壓縮,這是基于面壁智能的技術直接做的。
在這方面,面壁智能的核心技術壁壘主要源自高效多模態技術。視覺Token爆炸是多模態領域的一大瓶頸,面壁智能從2024年開始與實驗室一起,做了一系列高效視覺編碼的先進技術探索,除了發表的論文外,技術也演進到第四代,能夠支撐模型更加高效。
相比市面上絕大多數的模型都是4倍的視覺壓縮率,面壁智能在無損的情況下做到16倍的壓縮率,甚至能通過視覺編碼器內部的融合,實現計算量再進一步的發展。
端側VLA注重高效,因為云側和端側計算門檻不同,姚遠說:“我們一些原生的上下游記憶、世界模型都是值得期待的東西。”
他補充道,面壁智能首先想看模型智能密度是不是相對緊湊,因此選擇1B左右的先發模型基座。數據上的Scaling Law一定是成立的,越大量的數據會帶來更好的提升;參數的Scaling Law還沒有達成非常好的共識,可能是受限于實時推理速度的要求。
四、端側智能需要軟硬協同,達到GPT-5.6級水平還需兩三年
姚遠說,端側智能大腦是兩個趨勢共同疊加的效果:一是模型密度越來越高,相同的水平可以做的越來越小;另一方面就是終端計算能力越來越強。
劉知遠認為,將模型密度做得更高非常有挑戰性,并不是模型越大,技術含量就越高。
以芯片為例,制程最高的芯片是放在終端上的芯片,因為終端對空間、功耗要求更高,所以要求有一個電路密度更密的芯片。
云側和端側模型的能力區別很大:云側模型要求高并發,MoE架構會是它的默認選擇;端側模型用MoE架構不劃算,因為MoE架構需要一個大顯存,而顯存很貴。
端側是一個復雜的技術生態,需要軟硬協同、端云協同。端側智能的模型應與硬件密切結合。一些智能分別發生在云上和端上。同時,端側能起到數據采集作用。
劉知遠認為要讓端側模型達到像今年Claude或GPT-5.6模型這樣的水平,還需要1-2年、2-3年的時間。
受限于算力水平與模型尺寸,當前端側模型相對比較專用,可處理的任務類型有限。但面壁智能團隊相信,只要能夠在這個方向上再堅持1-2年的時間,就會迎來端側智能的大爆發。
他預測,未來智能會走向分化,每個行業都是充分競爭的,不會出現一家獨大。
五、開源是“AI留在血液里的信仰,面壁智能只做模型、不碰本體
“開源這個事情,應該是人工智能流在血液里面的信仰。”劉知遠說,AI行業能實現這么快的發展,有賴于開源,讓全球從業者都能第一時間站在最前沿的方向上接著往前走。
未來的具身智能發展一定有賴于開源的支持,因為有那么多本體,要做各種各樣的適配。
姚遠補充道,面壁智能希望先通過開源提供一個基礎設施,在端側設備上實現加速,同時在云端,比如高并發的產品上,也有較好的拓展性。
其意義在于,有時可以通過云端部署非常高效,由于模型本質上是高效的,因此能通過云端多并發的很多場景來提供服務。
這也能對訓練起到好的加速作用,比如強化學習,需要快速推理出結果去評判,用了面壁智能的框架之后能顯著降低訓練成本。
面壁智能只做模型,不碰本體,判斷“兩者都做”不如“只把模型做好”的勝算更大,希望通過技術的創新,嵌入到整個智能終端生態中,與上下游伙伴共建下一代智能終端。
“我們要去尋找好的合作伙伴,大家都能明確自己的邊界在哪兒,比如本體廠商目標就是要做質量最好、最便宜的、最有競爭力的本體,他能把這個事情做好,就已經是一個巨大的市場了。”劉知遠說。
他預測,未來具身智能發展路線會演化成不同的生態打法:一種是蘋果模式,什么都自己做;一種是安卓模式,有各種硬件廠商,共選統一的操作系統。
“我覺得完全就看這個企業有沒有喬布斯,有喬布斯了就可以蘋果,沒有喬布斯我建議就做兼容的模式。”劉知遠認為,更健康的生態應該是這樣的,任何一個企業的稟賦、基因、特點,決定了不可能每個東西都能做的對,只能聚焦把自己能做好的事情做到最好。
“我們還沒有找到我們的喬布斯。”劉知遠說,面壁智能希望未來是一個生態打法,就像“Wintel聯盟”互相協同,生態需要珠聯璧合、雙向奔赴,與廣泛本體廠商充分合作來推動快速發展。
面壁智能堅持做商業化,即便不認為當前是商業化的好階段,也要做,要跟上下游跟生態成為朋友。劉知遠相信,未來商業化不止是講技術,還關乎信任問題,面壁智能從不承諾自己做不到的事情。
結語:端側智能迎來規模化落地元年
北京智源人工智能研究院聯合端側實驗室發布的《端側智能2026——規模化落地元年》報告顯示,2026年端側智能正從概念驗證邁向規模落地,產業化拐點已然到來。
“跑得早、跑得快都不重要,重要的是你跑得準,你的未來發展方向是對的。”劉知遠談道,關鍵是能夠準確研判未來的發展趨勢,在當前這個時代,大家都在同一個起跑線上,誰能夠真正的做創新,誰才有可能在這一輪科技革命里取得先機。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.