![]()
長程(Long-Horizon)任務,是當前 AI Agent 亟需突破的難題之一。
在軟件工程、科學研究和復雜決策等場景中,Agent 往往需要在長程條件下連續決策,任何一步失誤都可能影響后續任務。過去,這類能力往往依賴更大的模型;擴展 Agent Horizon 也是另一個重要方向,但一直面臨基礎設施不足和異構能力難以統一的問題。
針對這些問題,上海AI Lab 團隊推出了一個 35B 參數大小的 MoE Agent 模型——Agents-A1,試圖不靠繼續堆參數,僅通過擴展 Agent Horizon,用更小的模型逼近萬億參數級模型的長程表現。
![]()
論文鏈接:https://arxiv.org/abs/2606.30616
研究結果顯示,Agents-A1 在多步搜索、科學研究和長指令遵循等部分任務上,已經展現出超過部分萬億參數級模型的表現,并在 35B 同規模模型中保持領先。
![]()
圖|Agents-A1 的基準測試表現。
不過,研究團隊也表示,Agents-A1 在工程類任務上仍與前沿大模型存在差距。
這項研究提出了一種更經濟的強大 AI Agent 開發方法:教它們養成更持久的、經過驗證的工作習慣,而不僅僅是擴大它們的參數規模。
Agent- A1 是如何設計的?
Agents-A1 是一個面向長程任務的 35B 參數 MoE Agent 模型。它依托長程知識-動作基礎設施,通過三階段訓練把多種 Agent 能力整合進同一個模型:先進行全領域 SFT,再專門訓練各領域教師,最后通過多教師 on-policy distillation(OPD)完成統一。具體流程如下:
1.全領域監督微調(SFT)
該階段旨在建立模型的通用 Agent 能力。研究團隊使用多領域、多任務的高質量長程軌跡數據進行訓練,增強模型在長上下文條件下的理解、推理和指令遵循能力;訓練中采用 sample packing,將多個較短樣本拼接到單個訓練序列中,并配合注意力掩碼防止樣本間串擾,從而減少 padding 開銷、提升 GPU 利用率。
2.領域級教師模型訓練
研究團隊將模型能力拆分為搜索、科學推理、指令遵循和工具調用四類專長教師,分別設計訓練方案。
- 搜索教師:采用“先 SFT、后 RL”的兩階段訓練,并結合 GRPO 提升復雜問題拆解、多跳搜索和工具協同能力,目標是在保證正確率的同時減少冗余搜索。
- 科學教師:通過兩階段 SFT,先強化科學推導能力,再通過工具增強軌跡訓練外部交互和證據整合能力。 讓模型學會何時借助外部工具,并整合檢索或計算得到的證據。
- 指令遵循教師采用:采用兩階段 RL 和 GRPO 訓練:第一階段提升格式、長度、關鍵詞和語言等細粒度約束滿足能力;第二階段強化長上下文 ICL 中的證據定位、信息整合和上下文規則遵循能力。
- 工具調用教師:采用工具 SFT 與工具 RL 的兩階段優化,重點學習何時調用工具、如何糾錯以及何時結束任務,并結合結果獎勵、過程獎勵和高質量困難任務復用提升工具使用能力。
3.統一模型階段
研究團隊先收集學生軌跡,再由對應領域教師打分指導。與離線模仿不同,教師直接評估學生自身生成的軌跡。最終,模型通過按領域路由的蒸餾和顯著詞匯對齊,兼顧全領域 SFT 的廣泛能力與各領域教師的專長。
![]()
圖|Agents-A1 三階段訓練流程概覽。
為支撐這一訓練流程,研究團隊構建了以知識-動作圖 KAG 為核心的知識-動作基礎設施,并通過自博弈不斷擴展高質量長軌跡數據。這樣訓練樣本不僅包含問題和答案,也能完整保留工具使用與驗證過程。
![]()
圖| Agents-A1 的知識-動作基礎設施概覽。
實驗結果
整體來看,Agents-A1 在長程搜索、指令遵循和科學推理等任務上表現突出,不僅領先同規模 35B 模型,也在部分基準上超過了部分萬億參數級模型。具體結果如下:
![]()
圖|Qwen3.5-35B-A3B、Agents-A1-SFT 和 Agents-A1 的性能對比。
1.全領域 SFT
結果顯示,Agents-A1-SFT 在長程搜索、工程任務和科學研究等方向上明顯提升,但在通用 Agent 任務、指令遵循和 HLE 上出現回落。這也說明,僅靠全領域 SFT 還難以緩解不同推理模式之間的沖突。
2.領域教師模型訓練
搜索增強教師:在四個基準上都穩定優于 Qwen3.5-35B-A3B。尤其在通用AI 助手基準 GAIA 上提升最為明顯,數值從 59.8 提升到 95.1。
![]()
圖|Qwen3.5-35B-A3B 與搜索增強教師模型的性能對比。
科學增強教師:兩階段 SFT 顯著增強了教師模型的科學推理和工具交互能力;相較基線模型,科學增強教師在各項科學任務上整體更優,尤其在 FS-R 上實現了從 2.5 到 54.3 的大幅提升。
![]()
圖|Qwen3.5-35B-A3B 與科學增強教師模型的性能對比。
指令遵循與長上下文學習實驗:強化學習顯著提升了模型的長上下文理解、指令遵循及對可驗證指令約束的泛化能力。總體上,RL 增強教師在相關評測中優于 Qwen3.5-35B-A3B,其中 LongBench V2 和 IFBench 的提升尤為明顯。
![]()
圖|Qwen3.5-35B-A3B 與 RL 增強教師模型在 LongBench V2、IFBench 和 IFEval 上的評測結果。
工具調用實驗:顯式工具使用監督與強化學習顯著提升了模型的工具調用能力,尤其在需要多輪、結構化交互的任務中效果更明顯;具體而言,工具增強模型在 τ2-Bench 和 VitaBench 上均取得了顯著提升。
![]()
圖|Qwen3.5-35B-A3B 與工具增強 RL 教師模型在 τ2-Bench 和 VitaBench 上的性能評測結果。
統一模型實驗:結果表明,多教師 OPD 較單純的全領域 SFT 更能緩解不同任務推理模式之間的沖突,在保留廣泛能力覆蓋的同時,更好地整合各領域專長,并進一步提升長程任務表現。
![]()
圖|Agents-A1 與 35B / 1T 級模型的對比。
除標準基準外,研究團隊還通過兩個案例展示了 Agents-A1 的長程 Agent 能力。以鯨魚叫聲檢測任務為例,Agents-A1 已經能夠在較長時間跨度內持續優化完整機器學習流程。模型在一次 12 小時運行中從簡單 CNN 基線出發,將驗證集 AUC 從 0.58 提升至 0.9935。這表明,Agents-A1 已超越局部調參,具備在多輪迭代中持續改進方案并提升泛化能力的能力。
![]()
圖|Agents-A1 在 ICML 2013 Whale Challenge 上一次 12 小時運行中的優化軌跡。
Agents-A1 在地球科學任務中也具備較完整的端到端分析能力。以 2008 年熱帶氣旋 Nargis 為例,模型能夠自動識別數據源,并完成數據提取、清洗、派生指標計算、可視化和結果綜合,形成從規劃到報告生成的多階段閉環,同時較高保真度地重建了風暴演化過程。
![]()
圖|由 Agents-A1 生成的 2008 年熱帶氣旋(Nargis)的路徑。
不足和未來方向
盡管 Agents-A1 在多項長程任務上表現較強,但仍存在一些不足。具體如下:
首先,模型在“先規劃再推理”“先反思再行動”、長上下文關鍵信息總結和重要歷史信息識別等基礎原子能力上仍有提升空間,這些能力會直接影響長程任務中的穩定性、目標一致性與執行效率。未來,需要重點強化這些基礎能力,并以此進一步提升 Agents-A1 的長過程求解能力。
其次,在機器學習工程任務上,Agents-A1 與更大模型之間仍有明顯差距。未來,如何增強模型在完整工程流程中的目標一致性、決策記憶與試驗效率,仍是一個重要研究方向。
最后,經過 OPD 訓練的統一學生模型,并不能在所有領域都穩定超過對應的教師模型。未來,如何在模型統一性與領域專長之間取得更好平衡,仍是后續需要解決的問題。
更多技術細節,詳見原論文。
作者:夏千斯
如需轉載或投稿,請直接在本文章評論區內留言
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.