![]()
從大語言模型(LLM)到智能體(Agent),代表了人工智能(AI)系統從“言”到“行”的范式躍遷。
更進一步,當多個 Agent 以組織形態出現,并通過協同合作、并行工作產出超越個體智能的成果時,AI 的下一個范式——“智能體組織”(agentic organization)——便出現了。
然而,盡管當前的 LLM 作為個體 Agent 已經展現出令人驚訝的推理能力,但要真正實現“智能體組織”的愿景,LLM 不僅要能夠獨立思考,還必須作為一個有組織的系統進行協同思考。
為此,微軟團隊提出了一個名為“異步思考”(AsyncThink)的 LLM 推理新方法,即把內部思考過程組織成可以并發執行的結構,從而解決現有并行思考方法中存在的延遲高、適應性、動態性差等難題。
實驗表明,與并行思考相比,AsyncThink 在提高數學推理準確性的同時,將推理延遲降低了 28%。此外,AsyncThink 還可以將其學到的異步思考能力進行泛化,無需額外訓練即可有效應對未見任務。
![]()
論文鏈接:https://arxiv.org/pdf/2510.26658
研究方法
AsyncThink 的核心為“組織者-工作者”(Organizer-Worker)思考協議。其中,LLM 扮演兩個角色:
一方面,它是一個“組織者”,負責把復雜問題拆分成子任務,并通過“Fork”(分叉)和“Join”(合并)來安排任務的順序;另一方面,它還是一個“工作者”,執行這些子任務并返回中間結果。
![]()
圖|AsyncThink 的思考協議示例。該協議通過 Fork-Join 操作實現異步思考,從而控制思考軌跡。
通過這種方式,模型不僅能并行處理多個子問題,還能動態調整思路,實現更靈活、更高效的推理。
為訓練 AsyncThink 模型,他們提出了一個兩階段訓練過程:冷啟動格式微調、強化學習。
1.冷啟動格式微調
這一階段是讓現有的 LLM 經過冷啟動格式微調,掌握AsyncThink 框架的組織語法與行動結構。
在數據合成環節中,由于現有語料中幾乎不存在“組織者–工作者”的思考樣本,研究團隊采用GPT-4o生成合成訓練數據。GPT-4o 首先分析每個輸入問題,識別出可獨立求解的思考片段;隨后按照AsyncThink 協議格式分別生成組織者與工作者的推理軌跡。
在結構初始化環節中,為了提升模型結構的靈活性,研究團隊隨機采樣不同的組織動作序列,并將其中一種結構樣例嵌入訓練提示中,讓模型在各種結構下都能學習,從而生成更具多樣性的思考拓撲。
在數據合成與結構初始化完成后,研究團隊對基礎 LLM 進行監督微調,賦予模型發出有效組織者行動的能力。
在這一階段,模型尚未學會用異步思考產生正確的答案,而只是模仿格式。
2.強化學習
由于第一階段只教授了組織者行動的句法結構,模型仍然缺乏利用這種思考機制來生成最終答案的能力。因此,研究團隊進行了第二階段——強化學習,通過獎勵來指導模型學習效率高、準確性高的策略。
![]()
圖|AsyncThink 強化學習框架示意圖。
在獎勵模型中,通過準確性獎勵確保最終答案是正確的;通過格式獎勵確保模型生成的軌跡是可執行的;通過思考并發獎勵促使模型尋找機會進行異步而非順序思考。
訓練時,研究團隊改進了群組相對策略優化(GRPO)算法,讓它適應異步結構。模型生成的不再是一條簡單的思維鏈(CoT),而是一個由組織者和多個工作者組成的“思考結構”。最終的獎勵會共享給整個結構的所有輸出,確保每個部分都朝同一個目標優化。
通過精細的獎勵模型和優化機制,AsyncThink 模型能夠動態且高效地協調其內部“智能體組織”來解決實際問題。
實驗評估
研究團隊評估了 AsyncThink 模型在多解倒計時、數學推理和數獨任務上的表現。實驗表明,與序列思考和并行思考模型相比,AsyncThink 始終能實現更高的準確性,同時降低延遲。
此外,研究團隊還通過消融研究進一步分析了其性能,凸顯了 AsyncThink“兩階段訓練過程”的有效性。
具體如下:
1.多解倒計時實驗
AsyncThink 的全對率達到89.0%,比并行思考(68.6%)和序列思考(70.5%)都高。這意味著它不僅準確率更高,還能覆蓋更多解答。
![]()
圖|多解倒計時任務評估結果。≥a Correct 表示模型能否成功找到給定問題的唯一正確解。
2.數學推理實驗
在 AIME-24 上:AsyncThink 的準確率為38.7%,延遲為1468.0;在 AMC-23 上:AsyncThink 的準確率為73.3%,延遲為1459.5。相較傳統并行推理,它在保證精度的同時減少了約 28% 的推理延遲。
![]()
圖|AIME-24 和 AMC-23 的數學推理評估結果。
3.跨任務泛化實驗
雖然只在倒計時任務上訓練,但直接遷移到 4×4 數獨時,AsyncThink 依然表現最好(準確率達到 89.4%,且延遲最低)。表明 LLM 學到的不是具體的模式,而是一種可遷移的組織性思考模式。
![]()
圖|AsyncThink 在 4 × 4 數獨任務上的評估結果。
4.消融實驗
在消融實驗中,研究團隊發現:格式微調(FormatSFT)能夠讓 LLM 學會“語言”,即如何 Fork 與 Join;而強化學習(RL)讓 LLM 學會“策略”,即何時 Fork、如何 Join 才能更快更準;并發獎勵(RηReward)則讓 LLM 學會“效率”——平衡準確率與延遲。
![]()
圖|通過移除 AsyncThink 的關鍵組件進行的消融實驗結果。
未來工作
盡管 AsyncThink 在提升 LLM 推理準確性和降低推理延遲方面表現出顯著優勢。但它只是實現“智能體組織”這一愿景的一個起點。
在未來的工作中,研究團隊將圍繞“規模/多樣性擴展”“遞歸智能體組織”“人-AI智能體組織”三方面繼續探索“智能體組織”。
1.擴展智能體的規模和多樣性
首先是擴展“工作者”的數量。未來的工作應該探索異步思考的 scaling laws:隨著智能體池容量從少數幾個增長到數百甚至數千,準確性-延遲的權衡將如何演變。
其次是擴展智能體的多樣性。超越同質化的智能體池,轉向由異構專家工作者組成的大型組織。這些智能體可以針對特定領域(如數學、編碼、數據分析)進行微調,且至關重要的是,它們可以配備不同的外部工具(如代碼解釋器、數據庫查詢引擎或網絡搜索 API)。這為組織者帶來了更復雜和更強大的學習問題。
2.遞歸智能體組織
在這個范式中,任何工作者都可以動態地被提升為子組織者,從而獲得 Fork 自己的子工作者團隊的能力。這將實現一個靈活的分層結構,自然地適用于需要多級分解的深度嵌套和復雜問題。例如,一個出色組織者可能會委托一個寬泛的查詢,例如“解決 * 問題”,而指定的工作者則充當子組織者,Fork 出三個新的子工作者并行獨立地測試不同的引理(lemmas)。
3.人類-AI智能體組織
一個關鍵前沿是通過將人類直接整合到智能體組織中來創建人類-AI協作框架。這可能涉及“人類作為組織者”,使用 Fork 協議將任務分配給 AI 工作者,或者“人類作為工作者”,由 AI Fork 出需要人類判斷的任務。此外,協作規劃將允許人類和 AI 在執行前共同設計異步策略。這一方向超越了純粹的 AI 自主性,將實現強大的混合智能。
整理:瀟瀟
如需轉載或投稿,請直接在本文章評論區內留言
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.