![]()
如何讓交互式 Agent 能像人類一樣學會“事后復盤”,更好地處理長程任務?
如今,強化學習(RL)已經成為重要的后訓練范式。然而,在長程 Agentic 學習中,基于結果的 RL 仍存在監督缺口:
失敗軌跡可能包含有用行為,一條成功軌跡也可能包含可復用策略,但基于結果的強化學習只能判斷任務成敗,難以指出哪些中間觀察、動作或工具調用應該被強化。
針對這個問題,清華大學清華大學自動化系常聘教授陶建華團隊及其合作者提出了“自進化同策略框架”(SElf-Evolving On-Policy Distillation,SEED),將已完成的同策略軌跡轉化為訓練時的事后(hindsight)技能,并將這些技能的行為效果蒸餾回策略模型中。
![]()
論文鏈接:https://arxiv.org/abs/2607.14777
結果顯示,基于文本和基于視覺的智能體任務上的大量實驗表明,SEED 能夠持續提升性能和樣本效率,并展現出對未見場景的魯棒泛化能力。
![]()
圖|整體性能概覽。
研究團隊表示,SEED 只使用已學習到的策略,在推理時無需外部記憶或額外提示,也能保留可復用的行為經驗。
SEED:自進化同策略框架
SEED 是一個自進化 OPD 框架,它會把當前策略完成的任務軌跡總結為后見技能,并將這些 skills 的行為指導蒸餾回策略模型。由此形成的訓練信號有三個特點:它來自當前策略的軌跡,能夠細化到單個決策詞token,并會隨著策略更新一起進化。
具體而言,SEED 有兩個訓練階段:
1.后見技能監督微調(hindsight skillSFT):研究團隊先收集基礎策略的交互軌跡,再由外部分析器將完整軌跡總結為后見技能。成功軌跡對應可復用策略或工作流,失敗軌跡對應糾正或規避規則。隨后,這些軌跡-技能對被用于微調模型,使其具備軌跡分析能力,并初始化后續的 RL actor 和軌跡分析器。
2.自進化同策略蒸餾(self-evolving on-policy distillation):在強化學習過程中,當前的策略模型既采樣任務軌跡,也作為分析器從這些軌跡中提取可復用的后見技能。隨后,SEED 會比較模型在有無后見技能時,對同一批動作的判斷變化,并把這種變化轉化為 OPD 訓練信號,與 GRPO 一起優化。通過反復執行“收集軌跡、分析技能、重新評分、蒸餾更新”的循環,SEED 會在多輪訓練中將這些后見技能蒸餾回策略。
![]()
圖|SEED 概覽。
更高性能、更強泛化
研究團隊在具身交互、網頁導航和搜索問答三類長程任務上評估了 SEED。整體來看,SEED在所有基準上的表現均顯著優于基于結果的強化學習和靜態蒸餾方法,并展現出了更高的樣本效率和更強的泛化能力。具體結果如下:
1. 基準測試表現
SEED 通過密集監督優于僅基于結果的 RL,并在長程 Agent 任務上表現出更強性能。相比 GRPO,SEED在三個基準上均穩定提升,ALFWorld 上可提升 45.9 個百分點。密集的 token 級后見監督可以改進僅依賴終端獎勵的強化學習。
內化技能優于比上下文提示。相比于 Skill-Prompt,SEED 在推理時無需額外技能提示,也能取得更好表現。
自進化后見蒸餾優于靜態自蒸餾。相比 OPSD、Skill-SD 等方法,SEED 整體表現更強,尤其在 ALFWorld 上優勢明顯。這說明,動態更新后的后見監督更有效,也更能適應訓練中出現的軌跡和失敗模式。
![]()
圖|在 ALFWorld、Search-based QA 和 WebShop代表性長程基準上的性能比較。
2. 訓練動態與樣本效率
SEED 在訓練動態和樣本效率上都優于 GRPO。以 ALFWorld 為例,訓練早期 SEED 的成功率就明顯領先,平均回合長度也下降更快,體現出更高的任務執行效率。
![]()
圖|ALFWorld 上的訓練動態。
SEED 能從完成軌跡中提取更有信息量的監督。在數據使用上,SEED 只使用 60% 訓練數據,表現就超過了使用完整數據訓練的 GRPO。
![]()
圖|ALFWorld 上的訓練動態。
3.跨領域泛化能力與多模態擴展
SEED 在未見任務環境中展現出較強泛化能力。在 ALFWorld 未見任務集上,研究團隊使用 Qwen2.5-3B-Instruct 訓練得到的模型版本進行評估。結果顯示,SEED 將宏平均成功率從 70.9% 提高到 86.2%,并在大多數任務族上超過 GRPO。研究團隊讓 Agent 執行加熱物體、查看物體和拾取物體等任務時,SEED 的提升最明顯。
![]()
圖|ALFWorld Unseen 上的跨領域泛化能力。
SEED 的能力也適用于純文本交互之外的視覺任務。研究團隊在 Sokoban 和 EZPoints 兩個視覺 Agent 基準上評估 Qwen2.5-VL-3B-Instruct。結果顯示,SEED 在兩個任務上都優于GRPO,平均成功率從 77.0% 提高到 91.0%。SEED 可以將多模態軌跡轉化為有效的后見監督,且評估時不需要額外 skill 提示。
![]()
圖|基于視覺的智能體基準上的結果。
4. 消融分析
SEED 的性能提升依賴初始軌跡分析能力、訓練中的持續蒸餾,以及來自當前策略軌跡。為了驗證各組件作用,研究團隊在 ALFWorld 上進行消融實驗。結果顯示,去掉后見技能 SFT 或自進化 OPD 都會降低性能;其中使用靜態技能庫替代策略自身生成的技能時,性能退化最明顯。
![]()
圖|消融實驗結果。
不足和未來發展
研究團隊指出,盡管 SEED 在具身交互、網頁導航和搜索問答等任務中表現較為穩定,但它仍然存在不足。
研究團隊指出,SEED 在更復雜任務中的表現仍有待驗證。DeepPlanning、OdysseyArena 等基準包含更長的工作流,最終成功信號也更為稀疏。因此,未來還需要在這類環境中進一步測試其在長上下文和復雜任務中的有效性。
同時,自進化機制也有一定風險。行動器和分析器使用的是同一套策略,因此如果模型在執行時犯錯,可能會把無效做法總結成可復用經驗,并在更新中繼續強化。未來的改進方向包括將技能更新更多建立在可驗證的狀態變化之上,或引入不確定性感知機制,以篩選出更可靠的指導信息。
此外,研究團隊指出,訓練成本也可能隨任務復雜度上升而增加。SEED 雖然不會帶來額外的部署開銷,但在訓練階段仍需要分析軌跡,并進行成對評分,可以在未來的工作中通過只分析關鍵軌跡、批量完成評分等方式,進一步降低訓練成本。
更多技術細節,詳見原論文。
作者:夏千斯
如需轉載或投稿,請直接在本文章評論區內留言
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.