今天,清華大學于超教授團隊聯合正行創新、無問芯穹,正式發布并開源 Harness VLA,這一技術成果首次將數字智能中廣泛應用的 Harness Layer 引入具身智能系統,在保持 VLA 模型凍結的基礎上,通過 Agentic Planner 對模型調用、任務執行和失敗恢復進行統一組織,讓機器人從「依賴單一端到端模型」邁向「模型能力與系統能力協同工作」的新架構,顯著提升機器人在復雜真實環境中的泛化能力。
在更具挑戰性的 LIBERO-Pro 擾動評測中,Harness VLA 將成功率提升至 82.4%,顯著超過 Pi_RLinf(50%)、NVIDIA Cap-X(18.2%)和 Berkeley RATS(43.8%),驗證了「模型 + 系統」的新一代機器人智能架構的可行性。更重要的是,Harness 并非針對某一特定模型設計,而是一種面向系統層的通用框架。除了 VLA,它同樣能夠與 WAM 等具身基礎模型結合,通過統一的任務執行層釋放不同基礎模型的能力,為未來具身智能系統提供更加通用的組織方式。
HarnessVLA 系統亮點介紹
過去兩年,Vision-Language-Action(VLA)模型幾乎已經把機器人操作的標準 Benchmark 的成功率做到了接近飽和。
例如,在 LIBERO 130 個任務中訓練的 Pi 0.5 模型,平均成功率高達 96%。從抓取、搬運到整理物體,大多數任務已經能夠穩定完成。
但這些漂亮的數字,并沒有真正回答一個更現實的問題:機器人離開標準測試環境之后,還能正常工作嗎?
當把同樣的模型部署在有目標重綁定與布局擾動的 LIBERO Pro 環境中,96% 成功率銳降至 50%。盡管動作依然流暢,局部操作本身也沒有明顯錯誤,但由于目標綁定、空間關系或任務階段判斷出現偏差,最終整個任務仍然會失敗。
這也是當前 VLA 最核心的挑戰之一:泛化能力不足。模型能夠完成訓練過的任務,卻很難穩定適應真實環境中的細微變化。
面對這一問題,一個自然的思路是繼續擴大模型規模、收集更多數據,希望模型本身能夠學習到更強的泛化能力。但數字智能的發展提供了一個值得借鑒的答案。
以 Claude Code、Codex 等 Coding Agent 為代表的新一代 AI 系統,能力提升并不僅僅來自更大的語言模型,更來自模型之外新增的一層執行組織系統(Harness Layer)。語言模型負責生成,而 Harness 持續維護上下文、調用工具、處理失敗,并決定模型在什么時候、以什么方式參與任務。越來越多的研究開始意識到,系統能力不僅取決于模型本身,也取決于模型如何被組織和調用。
那么,對于機器人而言,VLA 是否也需要屬于自己的 Harness Layer?
清華大學于超教授團隊聯合正行創新、無問芯穹提出的 Harness VLA,首次將 Harness Layer 引入具身智能。
這一思路得到了驗證,實驗發現了驚人的泛化能力。
在具有挑戰性的 LIBERO-Pro 擾動評估中,Harness VLA 達到 82.4% 的成功率,顯著超過 Pi_RLinf (50%)、NVIDIA Cap-X(18.2%)和 Berkeley RATS(43.8%)。整個過程中,底層 VLA 全程凍結,權重保持不變。
更重要的是,Harness 并非針對某一特定模型設計,而是一種面向系統層的通用框架。除了 VLA,它同樣能夠與 WAM 等具身基礎模型結合,通過改進模型被組織和調用的方式,釋放不同基礎模型的能力,提升復雜擾動環境下的任務成功率,為未來具身智能系統提供更加通用的組織方式。
這一發現或許意味著,具身智能需要經歷與數字智能類似的一次范式演進:從 End-to-End VLA,走向 Harness VLA。
![]()
- 論文鏈接:https://arxiv.org/pdf/2607.08448
- 項目主頁:https://harnessvla.github.io/
Harness VLA 重新定義了 VLA 在機器人系統中的執行方式
Harness VLA 給出的核心答案不是訓練一個更大的端到端 VLA,而是讓凍結的 VLA 專注于最擅長的接觸密集操作,并通過一層 Harness Layer 學會如何組織、調用和復用它。
![]()
圖 1 Harness VLA 系統框架。Agentic Planner 在交互過程中不斷學習 Primitive 的組織方式,并根據環境動態調度解析 Primitive 與 VLA_ACT Primitive。
在 Harness VLA 中,底層 VLA 被封裝為統一的 VLA_ACT Primitive,主要負責抓取、放置、按鈕按壓、抽屜 / 門操作等難以解析建模的接觸密集行為;而 MOVE_TO、ROTATE_WRIST、SET_GRIPPER、RELEASE 等 Analytic Primitives 負責穩定的空間移動、位姿調整、運輸和釋放。
真正的關鍵不只是把這些 Primitive 放在一起,而是讓 Agentic Planner 在閉環交互中學習它們的使用邊界:哪些階段應交給 Analytic Primitive,哪些局部接觸應交給 VLA_ACT Primitive,VLA_ACT Primitive 調用前需要怎樣調整視角和預接觸位姿,以及一次接觸失敗后應如何重新 Staging 并再次嘗試。
因此,Harness VLA 并不是執行一套固定流程的調度器,它的整個生命周期劃分為兩個不同的階段:探索式自舉階段(Exploratory Bootstrapping Phase)和嚴格的部署評估階段(Deployment Evaluation Phase)。
它在探索階段通過環境反饋不斷試錯,記錄成功的 Primitive 組合軌跡,并將其抽象為 Task Specific Memory;同時,它把跨任務可復用的成功規則和失敗模式沉淀到 Global Memory 中。在新的布局或任務擾動測試階段下,Agentic Planner 不會機械地重復舊坐標,而是利用當前觀測重新綁定目標和空間位置,再根據已有 Memory 組織 Analytic Primitive 與 VLA_ACT Primitive 的組合。
從這個意義上說,Harness VLA 學到的不是新的底層機器人技能,也不是對 VLA 權重的更新,而是如何更可靠地使用已有技能:它學習 VLA 的適用范圍,學習 Analytic Primitives 與 VLA Primitive 的組合結構,學習失敗恢復策略,并把這些經驗轉化為可復用的執行記憶。底層 VLA 始終保持凍結,但 VLA 被調用的時機、條件和上下文不斷被 Harness 優化,從而顯著提升整個系統在擾動任務、長程任務和跨場景任務中的執行效率與泛化能力。
![]()
圖 2 Harness VLA 的原理概念圖
三類任務結果,擾動、長程和遷移都達到 SOTA
Harness VLA 在三個具有挑戰性的機器人操作 Benchmark 上進行評估,分別覆蓋擾動泛化、家庭廚房長程任務和雙臂跨場景遷移。
其中,LIBERO-Pro 在原始桌面操作任務上引入目標重定向和位置交換等擾動,用于測試系統在語義重綁定和空間變化下的魯棒性;RoboCasa365 面向真實家庭廚房式操作,包含移動、抓取、放置、抽屜、水龍頭、微波爐等長程復合交互,用于評估 Harness 對復雜任務的組織、重試和恢復能力;RoboTwin C2R 則考察雙臂操作從 Clean 場景到 Randomized 場景的遷移,進一步驗證方法在多臂協作和場景隨機化下的泛化能力。
在所有評估中,Harness VLA 始終基于同一套固定的原語詞匯表P運行,并且不允許在部署階段引入新的原語。在下文各表中,Harness VLA (Codex) 和 Harness VLA (CC) 分別表示使用 Codex 規劃器和 Claude Code 規劃器實例化的同一套 Harness。
基于 Task Specific Memory 的少樣本評估 (Few-shot Evaluation)
少樣本評估的設定為:Harness VLA 已經在每個任務的 Seed 0 下通過探索和環境反饋不斷試錯,得到了一條該任務成功的 Primitive 組合軌跡 ,即 Task-Specific Memory ,隨后將 Harness VLA 直接應用到該任務的其他 Seed 中測試。這一過程與人類學習過程類似:先通過少樣本探索學習直至掌握,而后自行作業。
LIBERO-Pro,Harness VLA 使用 RLinf 開源的 pi05_libero130_fullshot 模型。表 1 匯總了 LIBERO-Pro 上的實驗結果,涵蓋 SPATIAL、OBJECT、GOAL 和 LIBERO-10 四類任務,并分別考慮指令重定向(instruction-redirection,T)和位置交換(position-swap,S)兩類擾動。現有端到端 VLA 模型在這些分布偏移下性能顯著下降;直接運行 RLinf 開源模型總體成功率為50.0%。Harness VLA (CC) 將這一結果提升至82.4%。值得注意的是,這一結果也顯著超越了領域內提出的 Code as Policy 方案 Cap-X 和 RATS。
![]()
表 1|LIBERO-Pro 上的總體成功率(%)。「/」表示該結果不可用或未報告。Cap-X 和 RATS 僅報告了 6 個不包含 LIBERO-10 的評測項,因此其總體結果僅對已報告的單元格取平均。
RoboCasa365,RoboCasa365 將評估范圍從桌面操作擴展到家庭廚房任務,其中包含移動平臺預置位、關節式機構操控,以及更長的復合操作流程。Harness VLA 使用凍結的 RLDX-1 模型。表 2 顯示,Harness VLA 將 RLDX 的成功率分別從 60%、21.3%、5% 提升到了 91.6%、56.3% 和 15%,達到 SOTA 性能。這些提升與預期的任務分工一致:規劃器負責導航、預置位,以及局部失敗后的重新預置位;凍結的 VLA 則繼續作為局部富接觸原語。
![]()
表 2|RoboCasa365 上的成功率(%)分隔線上方的基線結果來自相應先前論文在 ATOMIC-SEEN、COMPOSITE-SEEN 和 COMPOSITE-UNSEEN 三個評測的報告。
不使用 Bootstrapped Harness Memory 的零樣本評估(Zero-shot Evaluation)
LIBERO-Pro Goal,為了評估 Harness VLA 在不依賴記憶檢索時的在線決策能力,我們在零樣本(Zero-shot)設定下評估 LIBERO-Pro Goal。在該設定中,Harness VLA 不檢索目標設定下的 Task Specific Memory,也不使用對應的 Global Memory,而是僅依賴當前任務指令、實時 RGB-D 觀測、機器人狀態以及固定的 primitive 接口進行在線決策。
表 3 顯示,零樣本 Harness VLA 在兩種擾動設定下均優于 Cap-X:在位置交換(Pos-S)設定下達到31.0%,在指令重定向(Task-T)設定下達到79.0%;相比之下,Cap-X 分別為25.6%和16.8%。
這一結果說明,Harness VLA 的優勢不完全依賴記憶檢索:即使在 zero-shot 下,Agentic Planner 仍能在線調用 VLA_ACT 處理抓取、放置等接觸密集階段,并結合 Analytic Primitives 完成目標定位、位姿調整和釋放,因此優于僅依賴解析原語組合的 Cap-X。
但 zero-shot 與 few-shot 的差距也表明,僅靠在線推理還不足以穩定掌握最優 Primitive 組合,尤其在位置交換任務中,空間重定位、Staging、運輸和失敗恢復仍高度依賴 Task Specific Memory 與 Global Memory 中沉淀的執行結構和失敗模型。
![]()
表 3|LIBERO-Pro GOAL 上的逐任務成功率(%)。 比較零樣本 Harness VLA 與 Cap-X 的結果;Pos 表示位置交換,Task 表示指令重定向。
RoboTwin C2R,RoboTwin C2R 用于評估從 Clean 場景到 Randomized 場景的零樣本遷移:Agentic Planner 首先在 Clean 設定下探索得到 Task-Specific Memory,隨后將其直接遷移到 Randomized 任務實例中。在此過程中,不進行 Randomized 設定下的自舉、不增加額外的任務級探索。
![]()
表 4|RoboTwin C2R 上的成功率(%)。 各列比較了在 C2R 設定下,具有代表性的 VLA 基線與 Harness VLA 的性能。
82.4% 背后,是目標、狀態和分工三件事
Harness VLA 的設計建立在一個關鍵洞察上:
許多部署失敗,并不是 VLA 不會抓取、放置或操作,而是它在錯誤的目標、錯誤的狀態或錯誤的任務階段,繼續執行了一段局部上看似合理的動作。
Harness VLA 提升的并不是 frozen VLA 單次動作的能力,而是讓這些已有能力被用在更正確的地方。
第一,讓 VLA 作用在正確的目標上
當指令重新指定目標,或者物體與容器交換位置后,端到端 VLA 仍可能延續訓練時熟悉的目標和空間關系。
它的動作可能依然流暢:機械臂正常靠近、抓取和放置,但服務的對象已經錯了。此時,失敗的原因并不是動作執行不夠穩定,而是從一開始就選錯了目標。
Harness VLA 會由 Agentic Planner 根據當前任務指令和 RGB-D 觀測,重新判斷應該操作誰、目標位于哪里,再據此組織后續動作。
![]()
圖 3:LIBERO-Pro 中的目標重定向與布局交換。
如圖 3 所示,Frozen VLA 容易延續標準任務中熟悉的目標或空間關系;Harness VLA 則會重新綁定當前目標,再完成空間重定位、Staging 和局部接觸操作。
因此,它首先解決的不是「怎樣把機械臂移動得更準」,而是「當前究竟應該對誰做什么」。
第二,讓 VLA 在合適的狀態中被調用和再次調用
即使目標識別正確,如果讓 VLA 從任意距離、視角或機械臂姿態直接接管,它仍可能處在不熟悉的狀態分布中。這一問題也是分段解決長程任務會遇到的典型策略銜接問題。
Harness VLA 的關鍵在于,它不是簡單地把任務切成若干步驟,而是通過探索和記憶逐漸學習 VLA 的適用邊界:什么時候應該先調整空間關系,什么時候 VLA 已經處在可接管的局部操作區間,什么時候一次接觸失敗后需要重新 Staging 再次嘗試。換言之,Harness 學到的不是新的底層動作技能,而是如何為 Frozen VLA 創造更合適的調用條件,并在調用后根據反饋繼續組織執行。
調用前:讓 VLA 從更合適的狀態開始工作。
這種機制讓 VLA 不必從任意狀態端到端承擔整個任務,而是在更接近其優勢分布的位置上發揮作用。
![]()
圖 4:Harness VLA 對 Frozen VLA 的自適應調用。
如圖 4 所示,Agentic Planner 在移動、Staging、局部接觸和狀態檢查之間閉環切換;當局部操作不穩定時,系統可以先重新調整操作狀態,再發起下一次嘗試。
Harness VLA 沒有直接增強 Frozen VLA 的單次局部操作能力,而是減少長距離移動、空間搜索和姿態調整對它的干擾,讓它更多地處理自己擅長的局部接觸。
調用后:根據反饋決定是否再次調用。
一次 VLA_ACT 調用并不總能完成整個任務。對于長程操作,機器人可能需要在抓取、放置、開關部件等不同階段分別調用 VLA;而當某次局部操作沒有取得預期進展時,Harness VLA 也可以重新調整狀態,再次調用 VLA 進行重試。
關鍵在于,這并不是讓 Frozen VLA 在相同條件下機械地重復執行。每次調用之后,Agentic Planner 都會根據新的觀測判斷當前任務進展,并決定是繼續執行、使用 Analytic Primitives 重新移動和 staging,還是再次調用 VLA_ACT。
因此,第二次調用所面對的通常已經不是第一次調用時的狀態。機器人可能重新調整了機械臂位姿、夾爪狀態或與目標的相對位置,再讓 VLA 從更合適的局部狀態重新開始。
Task-Specific Memory 保存成功任務中可復用的 Primitive 執行結構,Global Memory 則積累跨任務的失敗規則和恢復經驗,幫助 Agentic Planner 判斷什么時候需要再次調用 VLA,以及調用前應該先進行怎樣的調整。
![]()
圖 5:不同 VLA Primitive 調用上限下的累計任務成功率
如圖 5 所示,橫軸表示每個 Episode 最多允許調用 VLA_ACT 的次數,縱軸表示累計任務成功率。隨著允許調用次數的增加,LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 上的成功率都在最初幾次調用后快速上升,并逐漸接近完整 Harness VLA 的性能。
這說明,由 Agentic Planner 完成 Staging 后進行的重復調用確實能夠提升成功率,但實際所需的調用仍然是稀疏的,并不依賴大量反復嘗試。
換句話說,Harness VLA 不再要求 Frozen VLA 一次調用就決定整條任務的成敗。每次調用前,Agentic Planner 會先判斷當前狀態是否適合交給 VLA,并在必要時完成目標定位、空間調整和 Staging;每次調用后,系統又會根據新的觀測判斷是否繼續執行、重新調整,或在新的局部狀態下再次調用 VLA。
真正有效的不是單純「多調用幾次」,而是在調用前把 VLA 放到更合適的接觸起點,在調用后用反饋決定是否需要少量而有針對性地再次調用。
第三,Analytic Primitives 將非接觸執行從 VLA 中剝離出來
Harness VLA 的一個重要作用,是將長程任務中的非接觸執行從 VLA 的職責中剝離出來。機器人任務并不是從頭到尾都需要學習型視覺運動控制;真正依賴 VLA 的,通常是局部接觸密集階段,而大量中間過程更適合由穩定、可控、可重復的 Analytic Primitives 完成。
這種分工減少了 VLA 需要覆蓋的任務范圍。VLA 不再需要同時承擔長距離移動、物體運輸、釋放和中間狀態維持,而可以專注于自身最擅長、也最難被解析建模的接觸操作。換言之,Analytic Primitives 并不是替代 VLA,而是把 VLA 從可解析的非接觸執行中解放出來,使其在更清晰的任務邊界內發揮作用。
圖 6 的任務完成歸因直接支持了這一點。在 LIBERO-Pro 系列任務中,許多成功 rollout 的最終完成判定發生在 Analytic Primitive 之后,說明 VLA 常常只負責建立關鍵接觸,而后續完成任務的是非接觸執行;而在 RoboCasa365 和 RoboTwin C2R 中,由于任務末端包含更多機構操作、受約束放置或雙臂交互,成功更常發生在 VLA_ACT Primitive 之后。不同 Benchmark 中完成歸因的差異說明,Harness VLA 并不是固定地偏向某一類原語,而是根據任務結構,將可解析階段交給 Analytic Primitives,將接觸密集階段交給 VLA_ACT Primitive。
圖 7 的代表性 rollout 進一步展示了這種分工:VLA_ACT 負責完成關鍵接觸,Analytic Primitives 則負責圍繞接觸階段組織非接觸執行,包括任務推進、狀態轉換和最終完成。二者結合后,Frozen VLA 不再需要端到端承擔整條任務,而是作為局部接觸能力被嵌入到一個更穩定的執行結構中。
這些證據共同支持了同一種任務分工:Analytic Primitives 圍繞富接觸階段組織整個任務,而 VLA 仍負責那些需要學習型視覺運動控制的階段。
![]()
圖 6|不同 Benchmark 上的任務完成歸因。 柱狀圖展示了成功 rollout 中,最終 Benchmark 完成判定謂詞是在 Analytic Primitive 執行后觸發(藍色),還是在 VLA Primitive 執行后觸發(橙色)的比例。
在 LIBERO-Pro 系列任務中,VLA 建立穩定接觸后,任務大多由 Analytic Primitives 完成;而 RoboCasa365 和 RoboTwin C2R 包含更多位于任務末端的富接觸操作,例如機構部件操控、受約束放置或雙臂物體交互,因此其成功 rollout 更常在 VLA 原語執行后完成。
![]()
圖 7|圍繞富接觸階段進行解析式分解的代表性 rollout 幀。
上排:在一個 LIBERO-10-PRO 位置交換任務中,智能體首先調用 VLA_ACT,隨后開始向籃子方向移動;但在執行 MOVE_TO 的過程中,系統檢測到 VLA 實際上并未成功抓住奶油奶酪盒。規劃器于是返回目標附近,再次調用 VLA_ACT;在成功抓取后,使用 MOVE_TO 和 RELEASE 完成該子任務。
下排:在 RoboCasa 的 STEAMINMICROWAVE 任務中,智能體首先通過 VLA_ACT 成功抓取碗,隨后持續搜索并調整位置,直到定位到微波爐;接著調用 VLA_ACT 將碗放入微波爐,并使用 MOVE_TO 將其進一步推入,隨后關閉爐門,最后通過 MOVE_TO 和 NAVIGATE_TO 完成開關按壓操作。
Harness VLA 的定位
Harness VLA 的出現,實際上位于三個研究方向的交匯點:VLA、Agent 和 Code as Policy。VLA 模型通過端到端學習視覺、語言與動作映射,顯著提升了機器人在富接觸操作中的能力。然而,這類模型通常同時承擔語言理解、任務規劃和低層控制,在長時程組合、目標重綁定和分布外部署場景中仍然存在明顯局限。
Harness VLA 將 VLA 的職責收縮到其最擅長的富接觸操作,而將目標定位、運動規劃、導航等確定性階段交由智能體和解析式控制完成。另一方面,Agent 和 Code as Policy 展示了 Coding Agent 強大的任務規劃、工具調用和組合泛化能力,但通常依賴解析式原語,難以處理復雜的接觸操作。
Harness VLA 將兩類方法結合:Agentic Planner 負責基于記憶進行閉環規劃、反饋和重規劃,而 Frozen VLA 作為一種新的高層原語負責執行富接觸技能,從而在不修改 VLA 參數和不擴展原語庫的前提下,實現更強的部署泛化能力。Frozen VLA 越強,Harness 可調用的能力越豐富;Harness 對執行流程的優化,又能將這些能力更穩定地轉化為完整任務的成功率。
開源!面向具身智能的智能體化基礎設施
正如 Harness Layer 推動了 Coding Agent 的快速發展,具身智能或許也正在進入一個新的階段:模型負責產生能力,而 Harness 負責釋放能力。 從「訓練一個更強的模型」走向「構建能夠持續學習、自主執行、不斷進化的智能體系統」,基礎設施的重要性正在被重新定義。
基于這一理念,Harness VLA 正式開源,并作為 RPent(Recursive Physical Agent,
https://github.com/RLinf/RPent) 開源生態中的首個核心項目發布。
![]()
RPent 是由清華大學于超教授團隊聯合正行創新、無問芯穹共同發起的新一代具身智能開源項目。在此之前,團隊推出的RLinf已成為全球首個面向具身智能大規模強化學習的開源基礎設施,GitHub Star 超過 4,100,入選 PyTorch Ecosystem,并被 NVIDIA 官方收錄,已被多家機器人企業和科研機構廣泛采用,在具身智能領域產生了廣泛影響。
如果說 RLinf 的目標是構建具身智能強化學習的訓練基礎設施(Training Infrastructure),那么 RPent 的目標則是構建具身智能持續進化的智能體化基礎設施(Agentic Infrastructure)。RPent 以「服務化、標準化、組合化」為核心設計理念,將模型、機器人、技能、記憶與環境統一納入智能體基礎設施。通過服務化實現能力解耦,通過標準化實現生態連接,通過組合化實現智能重構,讓具身智能系統能夠像軟件一樣被構建、擴展和持續進化。歡迎廣大研究者關注倉庫,貢獻代碼,共同探索具身智能新范式。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.