文 | 智能相對論
作者 | 葉遠風(fēng)
![]()
過去兩年,具身智能始終處在一種微妙的展示期,各家廠商的發(fā)布會總少不了幾段精美的概念視頻,機械臂精準疊放衣物,人形機器人流暢完成日常操作,畫面足夠驚艷,卻總難走出實驗室的聚光燈。
一旦走進光線雜亂的工廠、包裹堆積的倉庫,那些在公開榜單上跑分亮眼的模型,往往會陷入動作變形、任務(wù)中斷的窘境。
而剛剛舉辦的Action 2026原力靈機開發(fā)者大會,給出了另一種行業(yè)答案。
![]()
這場首屆開發(fā)者大會沒有只拿出單個模型炫技,而是一口氣發(fā)布覆蓋模型、本體、開發(fā)平臺、場景系統(tǒng)的四大類產(chǎn)品,把從技術(shù)研發(fā)到產(chǎn)業(yè)落地的整條鏈路全部鋪到臺面上。
所謂Action,不只是具身智能的核心命題,更是整個行業(yè)從概念驗證走向規(guī)模化落地的一聲開機號令。
行業(yè)拐點已至,泛化能力開啟2.0時代
行業(yè)內(nèi)已經(jīng)形成普遍共識,具身智能正處在一個類似大語言模型ChatGPT時刻的關(guān)鍵節(jié)點。
此前的階段更像是大模型1.0時期,各家拼參數(shù)、拼榜單、拼單點Demo效果,模型能力局限在特定場景特定任務(wù),換個物體換個環(huán)境就容易失效。
而現(xiàn)在,整個行業(yè)正在向2.0階段跨越,核心標志就是模型泛化能力的全面提升,以及從技術(shù)能力向真實生產(chǎn)力的轉(zhuǎn)化。
這個轉(zhuǎn)化過程并不輕松。
國內(nèi)不缺硬件廠商,不缺場景資源,也不缺數(shù)據(jù)采集能力,真正的卡點在于碎片化,不同硬件品牌接口各異,不同算法團隊各自為戰(zhàn),不同場景的數(shù)據(jù)無法復(fù)用。每落地一個新場景,都要從頭做硬件適配、模型微調(diào)、系統(tǒng)集成,成本居高不下,規(guī)模化自然無從談起。
原力靈機給出的判斷是,通用化是打破碎片化、走向規(guī)模化的唯一解法。具身智能的競爭從來不是單點技術(shù)或?qū)嶒炇褼emo的比拼,而是模型、系統(tǒng)、本體、平臺、場景全棧一體化能力的系統(tǒng)對決。
這次發(fā)布的多個產(chǎn)品、構(gòu)建的“三級火箭”,正是這套思路的完整落地。
![]()
從大腦到身體,筑牢通用能力底座
整套產(chǎn)品體系的核心,是全新升級的DM0.5通用具身基礎(chǔ)模型。
相比DM0,DM0.5參數(shù)量達到4B,基于15萬小時多源數(shù)據(jù)深度訓(xùn)練,數(shù)據(jù)量暴漲四倍,參數(shù)量提升一倍。數(shù)字背后是能力的代際躍升,整套模型的設(shè)計目標,就是從執(zhí)行固定指令的專用工具,轉(zhuǎn)向理解意圖、連續(xù)泛化、長時可靠運行的通用底座。
![]()
DM0.5的能力升級體現(xiàn)在多個維度。
零樣本與少樣本成功率的大幅提升,意味著模型不再依賴針對特定任務(wù)的反復(fù)訓(xùn)練,面對陌生物體和環(huán)境也能完整完成操作閉環(huán);
原生支持最長60秒的長時記憶,讓機器人可以處理多步驟的長程任務(wù),不會出現(xiàn)做了前面忘后面的短時窘境;
雙系統(tǒng)大腦架構(gòu)的引入,讓機器人在面對視角晃動、人為打斷等外界干擾時,也能自主判斷狀態(tài)并修正動作,適配真實場景的復(fù)雜環(huán)境,同時整套模型天然支持多種構(gòu)型的機器人本體,跨平臺遷移能力大幅增強。
![]()
對具身模型而言,參數(shù)規(guī)模從來不是最終目的,能不能在真實世界里穩(wěn)定干活,才是硬標準。
DM0.5還把微調(diào)成本壓低了六成,一塊消費級4090顯卡就能完成下游任務(wù)訓(xùn)練,最快18小時即可部署,徹底打通了真機落地的成本壁壘。發(fā)布會后模型權(quán)重同步開源,也在試圖把這套技術(shù)路線推向更廣泛的開發(fā)者群體。
![]()
而與此同時,本次大會還發(fā)布了Apex通用機器人本體。很多人會疑惑,一家以模型為核心的公司,為什么要親自下場做硬件?
答案藏在具身智能的特殊性里。
傳統(tǒng)機器人的硬件設(shè)計優(yōu)先考慮機械性能,大模型只是后來附加的功能,軟硬件之間往往存在適配損耗,模型的能力很難完全釋放。這次發(fā)布的Apex通用機器人本體,走的就是具身原生的路線,從硬件設(shè)計之初就圍繞大模型的運行特征打造。
![]()
Apex采用模塊化構(gòu)型體系,底盤、手臂、末端執(zhí)行器都支持快速更換,夾爪等末端工具一分鐘內(nèi)即可完成熱插拔,軟件端自動識別并無縫切換,無需重啟系統(tǒng)。整套本體的三層算力架構(gòu),底層負責(zé)1kHz高頻實時控制,保障動作平滑與安全,端側(cè)搭載本地算力芯片支持高頻實時推理,云端則對接大模型負責(zé)高層規(guī)劃與復(fù)雜決策,和DM0.5的能力分層形成完美匹配。
![]()
面向工業(yè)級場景的設(shè)計同樣值得關(guān)注。
Apex的平均無故障工作時間目標超過1000小時,支持30秒快速換電且換電過程中大腦保持熱備,業(yè)務(wù)流不會中斷。影子模式的加入,真機運行過程中可以無感采集真實場景的操作數(shù)據(jù),這些數(shù)據(jù)會成為模型迭代的核心養(yǎng)料——Apex不只是模型能力的展示載體,更是整個數(shù)據(jù)飛輪里最前端的采集終端。
三件套補齊中間層,打通落地最后一公里
有了強模型和好本體,距離真實產(chǎn)業(yè)落地還有一段距離。
具身模型要真正從能力走向生產(chǎn)力,中間還缺一套工程化、系統(tǒng)化、平臺化的支撐層。這次原理靈機推出的DexDev開發(fā)者平臺,包含DFOL2.0、DexOS、MaaS三款產(chǎn)品,分別對應(yīng)練得強、接得穩(wěn)、用得起三個目標,補齊了模型到場景之間的關(guān)鍵短板。
DFOL2.0解決的是模型迭代成本高的痛點。
過去模型優(yōu)化依賴真機采集數(shù)據(jù),需要在真實硬件上反復(fù)試錯,不僅效率低,還容易造成硬件損耗。DFOL2.0引入通用具身世界模型DW0.5作為高保真仿真器,把強化學(xué)習(xí)直接搬進虛擬世界。在仿真環(huán)境里可以批量生成各類軌跡數(shù)據(jù),模擬各種成功與失敗的場景,再用這些數(shù)據(jù)迭代優(yōu)化模型。
最終真機數(shù)據(jù)需求量下降六成,整體訓(xùn)練成本降低四成,模型迭代的速度不再受限于真機數(shù)量。
DexOS瞄準的則是行業(yè)碎片化的頑疾。
作為行業(yè)首個具身通用操作系統(tǒng),它屏蔽了不同硬件的底層差異,提供統(tǒng)一的標準接口協(xié)議。開發(fā)者只用少量代碼,就能完成機器人連接、感知獲取、模型推理和動作執(zhí)行,不用再針對每款硬件單獨啃底層協(xié)議。這相當(dāng)于給具身智能打造了一套通用操作系統(tǒng),一次開發(fā)就能在多款硬件上運行,大幅降低了適配門檻。
目前DexOS已經(jīng)完成對多款主流機器人構(gòu)型的適配,覆蓋機械臂、人形機器人等多種形態(tài)。
MaaS服務(wù)則把具身能力拉到了普惠層面。
它把具身大模型的能力做成按需調(diào)用的云端服務(wù),既有通用模型支持零樣本推理,也提供定制化的模型訓(xùn)練服務(wù),采用按量計費的模式。
![]()
中小企業(yè)和個人開發(fā)者不用投入巨額算力和研發(fā)成本,就能用上先進的具身模型能力。高門檻的技術(shù)變成了可靈活調(diào)用的服務(wù),整個行業(yè)的參與門檻被大幅拉低。
Ferrata落地緩沖,跑通商業(yè)與數(shù)據(jù)雙飛輪
即便模型能力再強,開發(fā)工具再完善,具身智能大規(guī)模落地依然繞不開一個死循環(huán)。模型不夠完美,企業(yè)不敢大規(guī)模部署到真實場景,可沒有真實場景的數(shù)據(jù)喂養(yǎng),模型又永遠沒法變得完美。很多具身智能項目就卡在這個死循環(huán)里,始終走不出實驗室。
Ferrata多智能體混合作業(yè)系統(tǒng),給出了非常務(wù)實的解法。
它不追求一步到位用機器人替換所有工作,而是搭建了一套分級作業(yè)的混合體系。簡單高頻的固定任務(wù),用傳統(tǒng)自動化設(shè)備完成,保證基礎(chǔ)效率和成本優(yōu)勢;復(fù)雜多變的長尾任務(wù),交給搭載具身大模型的機器人處理,覆蓋傳統(tǒng)自動化觸達不到的場景;遇到極端異常的情況,系統(tǒng)自動流轉(zhuǎn)到人工遠程接管,保證業(yè)務(wù)不會因為模型處理不了而停擺。
![]()
這套模式的核心價值在于雙輪驅(qū)動。
一方面,混合方案的整體成本可控,客戶能看到明確的投資回報,愿意規(guī)模化鋪開,形成穩(wěn)定的商業(yè)收入。
另一方面,所有作業(yè)過程中的數(shù)據(jù),包括成功的操作、失敗的案例、人工接管的處理方式,都會被結(jié)構(gòu)化記錄下來,回流到模型訓(xùn)練體系里。
模型越用越強,需要人工介入的場景就越少,方案的競爭力也會持續(xù)提升。
這也解釋了原力靈機此前合并Atomix的戰(zhàn)略意義——物流倉儲等真實產(chǎn)業(yè)場景,不只是商業(yè)收入的來源,更是模型迭代的最佳練兵場。有了真實場景的持續(xù)輸入,整個數(shù)據(jù)飛輪才能真正轉(zhuǎn)起來。
全棧布局背后,一場行業(yè)標準的卡位戰(zhàn)
縱觀整場發(fā)布會,最值得關(guān)注的不是某一項技術(shù)參數(shù)的突破,而是原力靈機完整的全棧布局思路。從核心模型到硬件本體,從開發(fā)平臺到場景解決方案,環(huán)環(huán)相扣,形成了能力向下傳遞、數(shù)據(jù)向上反哺的完整閉環(huán)。
過去的具身智能行業(yè),玩家大多聚焦在單點賽道,有的專注做模型,有的深耕硬件,有的只做場景集成,但具身智能本質(zhì)上是系統(tǒng)工程,單點突破撐不起真實落地。
沒有好的硬件,模型能力無處施展;沒有好的開發(fā)工具,落地效率提不上來;沒有真實場景的數(shù)據(jù),模型迭代沒有源頭活水。
原力靈機走的全棧路線,本質(zhì)上是用一套完整的方案,打破行業(yè)碎片化的困局,同時它也沒有走封閉路線,模型開源,開發(fā)框架開放,操作系統(tǒng)面向全行業(yè)硬件適配,希望用標準把更多玩家拉進生態(tài)里。
![]()
當(dāng)然,全棧模式也面臨挑戰(zhàn)。同時布局模型、硬件、平臺、場景,意味著要同時應(yīng)對多個賽道的競爭,對團隊的執(zhí)行力要求極高。自研硬件和開放生態(tài)之間也需要找到平衡,如何打消合作伙伴的顧慮,讓更多硬件廠商愿意接入這套體系,是接下來的關(guān)鍵課題。而Ferrata的混合作業(yè)模式,最終效果如何,也還要靠真實產(chǎn)業(yè)場景的交付數(shù)據(jù)來驗證。
回到這場大會的名字Action,三層含義里,最有分量的或許是那一聲片場開機的號令。過去幾年,具身智能行業(yè)拍了太多精美的概念預(yù)告片,講了太多關(guān)于未來的故事,而現(xiàn)在,隨著技術(shù)成熟度提升,隨著落地路徑逐漸清晰,行業(yè)終于到了喊出Action,走進真實片場實拍的時刻。
原力靈機的這套全棧方案,不會是具身智能落地的最終答案,但它確實捅破了一層窗戶紙,它告訴整個行業(yè),具身智能不用再等模型完美了再進場,不用再等硬件統(tǒng)一了再落地,用一套系統(tǒng)的方法,完全可以在真實場景里邊跑邊迭代,邊賺錢邊進化。
當(dāng)越來越多的機器人走進工廠、倉庫、門店,當(dāng)真實場景的數(shù)據(jù)源源不斷地反哺模型,具身智能的下一個爆發(fā)節(jié)點,或許比我們預(yù)想的來得更快。
*本文圖片均來源于網(wǎng)絡(luò)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.