黑板上隨手畫一筆,機器狗就能看懂,然后走出身后的三維迷宮。
這一幕,就發生在清華大學的一場現場演示中。
幾十位觀眾圍觀,任務隨機,環境開放,沒有預設腳本。
搭載了一念Unisonmind端側大腦的機器狗“哮天”,不僅能看圖走迷宮:
![]()
還能指揮人類用天平稱重:
![]()
甚至現場估算觀眾遞來的礦泉水瓶的剩余水量……
![]()
這個認知底座,還可以無縫遷移到人形機器人和電動輪椅上。
同一個大腦,不同的身體,正在真實世界里完成實時、持續的“感知—行動—反饋”閉環。
過去,行業對于Physical AGI的討論往往陷入路線之爭,或沉迷于虛擬Benchmark的刷榜。
而這場演示真正的價值在于,它以人類智能為天然標尺,提供了一套可逐項驗證的物理通用智能標準。
人類智能,定義Physical AGI的天然標尺
回到人類智能,我們可以稱之為Physical GI,它究竟是以何種方式運行于真實世界?
上世紀八十年代,哈佛發展心理學家霍華德·加德納提出:“智力的基本性質是多元的——不是一種能力而是一組能力,其基本結構也是多元的。”
它是同一個認知系統,在真實時空中持續運行,并面對不同對象與任務,形成人類的多元智能。
如果說人類智能是進化造就的物理通用智能,那么Physical AGI(物理通用人工智能)就是對這一形態的人工復刻:
一套以實體為載體、在真實世界中持續運行的“認知范式”。
它可以調度感知、表征、記憶、學習、推理、規劃、生成與反饋調節等基礎認知能力,理解適應復雜情境、并作用于環境,在語言、空間、物理、行動、社會與時間等多個維度形成泛化智能,最終通過實體與環境構成實時、持續、可自適應的“感知—行動—反饋”閉環。
當定義清晰,判斷便不再是口號與路線之爭,而是一套可逐項驗證的標準,問題也隨之而來:
Physical AGI究竟需要具備哪些能力?
這些能力能否在無預設的真實現場中被觀測、被復現?
帶著這一可驗證的標尺,回看一念Unisonmind在清華大學的現場演示,我們便能讀懂這場演示真正的參照價值。
先看現場。
這是一個有幾十位觀眾在場圍觀,任務隨機、環境開放,沒有預設腳本的真實現場。
一念Unisonmind:同一個大腦,涌現多項領域智能 機器狗“哮天”看圖走迷宮
黑板上隨手一幅簡筆畫,機器狗便理解是身后的三維迷宮。
主持人在圖上圈出一個位置,它便去場地里尋找對應物體。
最后,主持人隨手畫出一個“8”字。
哮天先問“能不能走捷徑”;走完捷徑,又按圖行進。
它蹭到迷宮板時,現場有觀眾“洞見真相”。看來不是它避障失誤,而是黑板上的路線本就與墻體相交。
這個任務不僅需要空間智能,還需要表征、抽象、規劃與反饋調節,來一起完成。
機器狗指揮人類使用天平
還是裝載Unisonmind大腦的機器狗“哮天”,讓人類助手使用天平秤,給隨機找的幾個物品稱重量。
物理智能、語言交流、行動規劃和社會協作,這些領域智能一并使用,才能解題。
觀眾臨時拿出兩瓶水
真實世界的問題,完全不像benchmark那樣規整,也無法每項任務都訓練過。
一位觀眾臨時拿出兩瓶喝過的礦泉水,問:瓶子里還剩多少水?
這不是預設題目。哮天看了一眼,說:“你先把礦泉水瓶標簽撕了。”
同一個大腦,進入不同身體
同一個Unisonmind端側大腦,還運行在另一只機器狗、人形機器人和電動輪椅上。
這意味著,同一個端側認知底座可以進入不同本體。
比如,另一只機器狗:
人形機器人:
電動輪椅:
由它組織出的能力,也可以隨身體與場景變化被重新調用。
身體不同,認知底座相同。
Physical AGI的能力至少有哪些?
走迷宮、稱重量、估水量,這些任務彼此獨立,沒有經過針對性預訓練與后訓練,有題目是觀眾現場即興提出。
而完成所有任務的,是同一個一念Unisonmind大腦。
支撐這種泛化能力的,是同一組基礎認知能力:感知、表征、抽象、記憶、推理、規劃、生成與反饋調節。
當這些基礎能力面向不同的處理對象時,便自然呈現為不同維度的領域智能,共同構成了Physical AGI的基本能力結構。
![]()
Physical AGI從來不是語言、空間、物理等模塊的簡單拼接,而是同一套基礎認知體系面對不同對象時,自然分化出不同的能力面向,并在具體任務中動態組合,共同解決開放世界中的通用問題。
現場演示印證了這一點:所有能力都從同一個持續運行的認知系統中被統一調度、協同配合。
模型結構:能力統一涌現的底層邏輯
現場表現需要底層結構的解釋:為什么多種領域智能,能同時出現在同一個模型中?
這些案例有一個共通的本質:它們都不是一次輸入換一次輸出,本體需要在看、聽、說、行動之間持續切換,在環境的實時反饋中不斷更新判斷、調整行為。
Unisonmind一念團隊給出的答案,是一套“統一世界Token空間”的模型架構:
多模態輸入匯入同一個統一的狀態空間,世界的當前狀態在其中持續演化;
模型根據任務需求輸出語言、聲音、動作等多模態結果,而外部世界的反饋又成為下一輪輸入,形成閉環。
![]()
這套架構,可以概括為「3+1」的核心特征:
1|全模態 Any-to-Any
視頻、圖像、聲音、文字和動作,輸入端多模態進,輸出端多模態出,在同一個模型。
2|理解與生成統一
路線被看見、指令被理解、狀態被預判、行動被生成、聲音被輸出,在同一個模型。
3|全鏈路 Runtime
模型常駐運行,持續接收信息、18毫秒一次對齊狀態、做出反應,再從結果中修正。
+1|端側本體部署
整套模型運行在機器狗、人形機器人和輪椅端側,直接置于真實世界閉環。
身體可以變化,統一狀態空間和認知鏈路保持不變。
“3+1”讓現場現象有了結構上的解釋:語言、空間、物理、行動和協作,在同一個常駐運行的模型里,隨任務臨時組合、自然協同。
一念Unisonmind跨過了Physical AGI的門檻
回到文章最初的問題:一念Unisonmind是否已經跨過了Physical AGI的基本形態門檻?
按照我們從人類智能推導出的定義,Physical AGI的核心,是同一個通用認知系統,能夠以實體為載體進入真實世界,持續組織多維度智能,并在環境反饋中自主迭代。
而這些特征,都已經在這場開放現場中得到了驗證:
同一個Unisonmind大腦運行于不同形態的實體之上,在未經顯式訓練的任務中,完成了持續的感知、理解、推理、規劃與行動,與真實世界形成了完整的交互閉環。
現場給出了能力實證,模型結構解釋了能力統一的底層邏輯,跨本體運行則證明了這套認知體系的通用性——
它不綁定某一種身體,而是可以適配更多實體形態。
從這個定義出發,我們可以說:一念Unisonmind已經跨過了Physical AGI的基本形態門檻。
這不是一個終點式的宣告,而是一個起點式的確認。
它意味著一種新的智能存在方式已經真實出現:同一套“人類認知范式”,能夠以實體為載體,在真實世界中持續運行,并根據任務自主組織多元領域智能。
Physical AGI曾是遙遠的技術想象。此刻,它走出了定義的迷霧,踏上了真實世界的土地。
文章來源:量子位。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.