![]()
出品|虎嗅黃青春頻道
作者|商業消費主筆黃青春
題圖|視覺中國
外界總揶揄騰訊在 AI 賽道“起大早趕晚集”,這顯然低估了其野心。
事實上,騰訊的布局草蛇灰線,伏線千里:從底層混元大模型,到中間層智能體開發平臺 ADP、具身智能平臺 Tairos,再到應用層 WorkBuddy、CodeBuddy 等產品,一條從底層技術到終端應用的落地路徑脈絡清晰。
其中,具身智能作為騰訊向物理世界延伸的“戰略要塞”,由騰訊首席科學家、Robotics X 實驗室主任、福田實驗室主任張正友帶隊,摸索出一套與行業主流“端到端單模型”截然不同的技術路線,底層邏輯直指具身智能的本質:語言不等于完整認知,真正的智能必須在“感知、決策、行動”的閉環中形成。
具身智能為何不智能?
張正友以神經科學經典的“裂腦實驗”點破行業通病:當前多數具身方案過度依賴語言模型邏輯,錯將流暢描述任務視作真正理解了物理世界。
事實上,人腦左腦負責語言與邏輯推理,右腦負責空間感知與圖像認知,語言只是智能的對外表達通道,并非認知的全部。
基于這一判斷,騰訊構建了三層異構的具身智能架構 Apexio,精準對應人腦的認知決策、感知行動、條件反射:
最上層為認知系統:按需喚醒,調用大模型完成深度推理與任務規劃,核心回答“要做什么”;
中間層為感知行動系統:接收視覺等環境信息并快速調整行為,負責“怎么動態調整”;
最底層為反射系統:以更高頻率運行,無需經過語言推理,像條件反射一樣處理碰撞、失衡等突發狀況,具備“即時自保”能力。
在張正友看來,這套分層架構是面向真實場景的長期技術路線,其核心優勢貼合物理世界的運行規律。
此前,行業單一端到端模型要求感知、決策、執行全鏈路同頻運算:要么為保障認知精度拉高推理延遲,無法滿足實時性要求;要么為壓縮響應速度犧牲深度推理能力,難以處理復雜任務,導致主流具身模型存在普遍短板:一類靠文本拆解任務,邏輯清晰卻落不了地;一類能生成預測畫面,卻講不清規則與邊界。
與之對應,分層架構能讓不同能力模塊各司其職,既保留了上層的深度思考能力,又滿足了底層的實時反應需求,與人腦運行邏輯高度契合,是更具穩定性的長期技術架構。
據虎嗅了解,騰訊發布的 RxBrain (騰訊 Robotics X 聯合混元發布并開源的具身世界認知基座模型)實現了兩類核心能力打通:面對復雜任務,它既能用語言拆解執行步驟、明確規則約束,也能同步生成每一步的目標場景圖像。這種“先想象目標,再執行動作”的模式,解決了大量文本難以精準描述的場景問題。
比如擺放西餐餐具,用文字定義規則需要大量篇幅,一張目標圖即可清晰傳遞要求。執行過程中,機器人還能實時對比當前畫面與目標畫面,判斷執行進度,發現偏差及時重新規劃,顯著提升任務完成效率。
張正友補充稱,騰訊自研的 HyVLA-0.5 模型已實現工業級落地,依托自研亞毫米級 UMI 穿戴式數據采集手套,積累了超過 1 萬小時的人類第一視角操作數據。其采用雙路徑訓練模式:一條針對特定機器人本體做精細化微調,保障場景適配精度;一條通過 UMI 數據實現跨本體遷移,提升通用適配能力。部署環節則通過異步推理與軌跡平滑技術,實現高頻閉環控制。
虎嗅溝通發現,這套模型已在日化品工廠產線完成落地實測,作業成功率超過 95%,新增品類(SKU)適配周期不到 3 天,完全滿足工業產線的嚴苛要求。
除了產線落地的成績,HyVLA-0.5 在權威仿真評測中也拿下綜合排名第一,在核心的長時序任務、記憶任務兩個維度同樣登頂,完成了從實驗室指標到真實生產力的跨越。
Tairos要做具身時代的“大腦”
此前,騰訊始終明確不做機器人硬件,一度曾引發外界質疑。
對此,張正友以手機行業格局類比:行業最終會形成兩種成熟模式,一種是蘋果式的軟硬件全閉環,體驗最優但生態封閉;另一種是安卓式的底層系統賦能,開放生態、規模化落地。
如今,騰訊選擇的正是第二條路。這很大程度上源于,中國機器人本體制造能力已高度成熟,迭代快、穩定性強,騰訊無需重復造輪子。
騰訊的核心優勢在 AI、云與連接能力,因此 Tairos 定位是做具身智能的“通用大腦”:向上支撐應用開發商,向下賦能機器人本體廠商,讓硬件廠商無需從零搭建智能能力,讓應用廠商無需適配五花八門的硬件,整體降低行業落地門檻。
據虎嗅了解,落地數據已驗證這一戰略的價值:首次和宇樹打磨導覽場景時,基礎適配花了三個月,依托標準化接口后,新增場景 5 天即可落地;給越疆機器狗做系統適配更是只用了一天就完成部署。
張正友透露,騰訊選擇優先綁定越疆、宇樹、智元等頭部本體廠商,核心邏輯在于:頭部廠商的硬件穩定性高、問題少,算法打磨效率更高。“一旦與頭部廠商跑通標桿場景,圍繞其布局的集成商、生態客戶即可快速復制方案,實現做通一個、輻射一片的效果,效率遠高于零散對接中小廠商。”
值得強調的是,具身智能核心瓶頸仍是數據,亦是當前行業投入成本最高的環節。
張正友認為,當前行業普遍依賴的遙操作數據,正處于金字塔頂端,成本高、規模小、泛化性差。騰訊的思路是打通四層數據體系:用底層大規模數據做預訓練,提升模型泛化能力;用頂層高精度數據做微調,適配特定場景,最大化數據利用效率。
即便騰訊并非數據采集服務商,但其核心優勢在于模型研發與數據生產的聯動:模型團隊明確數據優化方向,反向指導數據廠商定向采集高價值數據,再通過騰訊云的存儲、計算能力,為具身智能企業提供數據存儲、處理、訓練的一體化解決方案,形成“數據 - 模型 - 云”的完整閉環。
算力層面,具身智能的需求正呈爆發式增長。
騰訊云異構計算研發總監陳煜東透露,具身智能客戶的算力需求年增速達 200%-300%,訓練規模從百卡級躍升至千卡、萬卡級;模型迭代周期縮短至兩三天,多模態數據清洗、標注的算力消耗也同步暴漲。
至于國產芯片的適配難題,陳煜東給出了高效解法:用 AI Agent 輔助算子遷移。“過去工程師手動遷移一個算子平均需要 5 天,如今通過 Agent 人機協同,一天就能完成精度達標、性能更優的遷移,大幅降低國產算力的使用門檻。”
當前,具身智能行業同質化嚴重,本體形態、落地場景都高度扎堆。張正友認為,這是行業早期的正常狀態,規模化落地尚未啟動,玩家集中探索可行場景并非壞事,充分競爭會加速技術迭代。
所以在落地節奏上,行業必然遵循“從易到難”的路徑:工業場景會率先實現規模化落地,因為環境結構化、物體類別少、任務標準化,數據需求相對可控,更容易達到生產級要求;而家庭、養老等非結構化場景,落地難度要高得多,核心門檻是安全。
張正友一再強調,進入家庭場景的機器人,安全性必須做到 100%,沒有任何妥協空間。“要實現安全的人機接觸,觸覺、力覺感知是必備能力。沒有力覺控制的機器人,攙扶老人時可能造成骨折,根本無法進入養老、康復等場景。”
綜上,騰訊在 AI 領域并不執著于技術噱頭式領先。互聯網時代,其靠連接人與人、人與服務、人與內容建立壁壘;AI 時代,它要靠連接模型與場景、智能與硬件、開發者與產業,成為 AI 基建的“水電煤”。
# 虎嗅商業消費主筆黃青春、黃青春頻道出品人,關注文娛社交、游戲影音等多個領域,行業人士交流加微信:724051399,新聞線索亦可郵件至huangqingchun@huxiu.com
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4877199.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.