![]()
來源:機器之心
本文來自PRO會員通訊內(nèi)容,文末關(guān)注「機器之心PRO會員」,查看更多專題解讀。
![]()
過往大模型推理優(yōu)化主要圍繞語言推理鏈的結(jié)構(gòu)化與搜索增強展開。但在網(wǎng)頁交互、工具調(diào)用等動態(tài)任務中,推理對象已從靜態(tài)文本轉(zhuǎn)向隨動作變化的環(huán)境狀態(tài),問題本質(zhì)從語言生成擴展為環(huán)境中的決策。現(xiàn)有 CoT、ToT 等方法仍主要在文本空間內(nèi)優(yōu)化推理路徑,并未對環(huán)境狀態(tài)轉(zhuǎn)移進行顯式建模。世界模型的引入正是為了彌補這一缺口,通過建模動作與狀態(tài)變化的映射關(guān)系,為 LLM-based Agent 提供環(huán)境預測能力,以支撐更穩(wěn)定的決策過程。
目錄
01. 從局部自動化到全供應鏈質(zhì)變,AI 如何重構(gòu)傳統(tǒng)的勞動力與資本份額?
AGI 時代的稀缺性到底會如何重塑全球經(jīng)濟的底層邏輯?全供應鏈自動化為什么會讓傳統(tǒng)的勞動力與資本分配模型失效? ...
02. 邁向全自動化的過渡期,人類為何終將被機器經(jīng)濟排斥?
人類勞動的最后一道稀缺性防線 「關(guān)系型部門」 真的能守住嗎?「混亂的中間地帶」 會給社會帶來哪些難以預料的政治經(jīng)濟學危機? ...
03. 邊緣經(jīng)濟體如何避免被算力供應鏈淘汰?
AGI 創(chuàng)造的巨額財富該如何進行公平且可持續(xù)的社會再分配?為什么具有極高財富積累偏好的實體會主導未來的全球資本格局? ...
世界模型如何幫助 Agent 解鎖動態(tài)交互能力?
1、近年來,當 LLM 落地應用在網(wǎng)頁操作、工具調(diào)用、代碼運行、長時序任務規(guī)劃等動態(tài) Agent 場景時,推理不再局限于文本生成,而是延伸至行為決策領(lǐng)域。然而,模型在靜態(tài)基準測試中的優(yōu)異表現(xiàn),與其在真實動態(tài)交互環(huán)境中的推理效果之間存在明顯差距。
① 網(wǎng)頁導航、代碼編輯、工具使用和長周期對話等場景均屬于動態(tài)環(huán)境,其狀態(tài)隨動作持續(xù)演化,要求模型具備前瞻預測能力,且單步誤差可能沿決策鏈逐級累積。靜態(tài)環(huán)境則通常不存在狀態(tài)變化與誤差傳遞。[1]
② 靜態(tài)評估忽略推理過程中的中斷與環(huán)境變化,會系統(tǒng)性高估模型在動態(tài)任務中保持推理正確性與完成任務能力的表現(xiàn)。在數(shù)學推理與代碼生成任務中,引入中斷或上下文變化后,模型性能最高下降可達 60%。[2]
2、圍繞提升 LLM-based Agent 推理能力的目標,業(yè)界陸續(xù)提出 CoT、Self-Consistency、ToT、LATS 等優(yōu)化方法,從不同角度強化模型表現(xiàn)。但這些方法并未觸及核心問題。但這些優(yōu)化本質(zhì)上仍在文本空間內(nèi)改進推理路徑,并未賦予模型預判動作后果的能力,因而無法真正解決動態(tài)環(huán)境中的推理短板。
① CoT 的單向線性推理存在結(jié)構(gòu)性局限,其輸出的鏈式推理文本并不能完整還原真實的內(nèi)在決策過程 。研究者進一步發(fā)現(xiàn),CoT 及其推理變體在不同模型規(guī)模和基準復雜度下持續(xù)不如直接回答 。[3][4]
② ToT 和 LATS 的改進仍局限于文本空間內(nèi)的路徑優(yōu)化,并未對環(huán)境轉(zhuǎn)移進行顯式建模。面對網(wǎng)頁提交、代碼發(fā)布、API 調(diào)用這類不可逆操作,依賴此類方法的 LLM-based Agent 在實際部署中的效果有限。[5]
3、近期,EvoAgent、WebEvolver、COMAP、RWML、ProPlay 等工作嘗試通過「世界模型」賦予模型預測狀態(tài)轉(zhuǎn)移的能力,嘗試緩解動態(tài)環(huán)境中因不可逆操作與狀態(tài)追蹤困難導致的決策失效問題。
① 世界模型與前述推理優(yōu)化方法的差異在于世界模型的建模對象是環(huán)境狀態(tài)轉(zhuǎn)移本身,使 LLM-based Agent 在執(zhí)行動作前即具備對后果的預判能力。[6][7][8]
② EvoAgent 提出持續(xù)世界模型,使智能體在開放世界中通過自規(guī)劃與自反思完成長時程任務,無需人工干預。在 Minecraft 和 Atari 上,該方法相較現(xiàn)有方法平均成功率提升 105%,無效動作減少 6 倍以上。[6]
③ WebEvolver 將協(xié)同進化的世界模型引入 Web Agent 框架,在推理階段通過前瞻模擬指導動作選擇。在 Mind2Web-Live、WebVoyager 等真實網(wǎng)頁環(huán)境中,該方法相較現(xiàn)有自進化 Agent 取得了 10% 的性能提升。[7]
④ COMAP 通過閉環(huán)交互讓文本世界模型與 Agent 策略協(xié)同進化。世界模型預測候選動作的未來狀態(tài),Agent 據(jù)此優(yōu)化動作,生成的軌跡再通過自蒸餾更新世界模型。在具身任務規(guī)劃、Web 導航和工具使用基準上,COMAP 在 Qwen3-4B 上實現(xiàn)了 16.75% 的相對提升。[8]
⑤ RWML 通過 sim-to-real gap 獎勵在文本狀態(tài)上學習動作條件世界模型,將模擬的下一狀態(tài)與真實觀測對齊。在 ALFWorld 和 τ2 Bench 上,RWML 結(jié)合任務成功獎勵后分別比直接使用任務成功獎勵的 RL 高出 6.9 和 5.7 個點。[9]
⑥ ProPlay 提出程序性世界模型,將成功軌跡抽象為程序并在程序圖中組織,支持 Agent 在執(zhí)行前預演未來的程序路徑。實驗表明該方法在環(huán)境理解與自進化能力上持續(xù)優(yōu)于強基線。[10]
4、業(yè)界圍繞世界模型的討論重點集中于,動態(tài)交互任務要求模型同時具備狀態(tài)理解、結(jié)果預測和長期規(guī)劃能力。世界模型能夠為 LLM-based Agent 補上「執(zhí)行前預判后果」與「脫離真實環(huán)境進行策略學習」的能力,有希望從根本上解決動態(tài)環(huán)境中因狀態(tài)追蹤困難與動作后果不可逆導致的決策失效問題。[1]
① 在推理階段,世界模型能夠根據(jù)候選動作預測后續(xù)狀態(tài)變化,并利用預測結(jié)果對動作進行驗證和篩選。WebEvolver 在推理階段引入預測機制,在真實網(wǎng)頁環(huán)境中較現(xiàn)有自進化 Agent 取得了 10% 的性能提升。[7]
② 在訓練階段,世界模型可作為虛擬環(huán)境生成交互軌跡或模擬用戶反饋,降低訓練過程對真實環(huán)境的依賴;可進一步引入動態(tài)更新機制,使世界模型與智能體策略協(xié)同優(yōu)化,以緩解環(huán)境分布變化帶來的影響。[8][9]
世界模型如何優(yōu)化 AI 的環(huán)境推理能力?
1、傳統(tǒng) LLM-based Agent 采用反應式架構(gòu),缺乏對環(huán)境如何結(jié)構(gòu)化演化與變化的顯式建模,因而在網(wǎng)頁導航、代碼編輯、長周期對話等動態(tài)交互任務中表現(xiàn)受限。近期用世界模型改善推理能力的探索分別從訓練、推理、評估等維度切入,通過賦予模型預測動作之后環(huán)境狀態(tài)如何變化的能力,實現(xiàn)更優(yōu)的動態(tài)任務適應能力...
閱讀最新前沿科技趨勢報告,請訪問21世紀關(guān)鍵技術(shù)研究院的“未來知識庫”
![]()
未來知識庫是 “21世紀關(guān)鍵技術(shù)研究院”建 立的在線知識庫平臺,收藏的資料范圍包括人工智能、腦科學、互聯(lián)網(wǎng)、超級智能,數(shù)智大腦、能源、軍事、經(jīng)濟、人類風險等等領(lǐng)域的前沿進展與未來趨勢。目前擁有超過8000篇重要資料。每周更新不少于100篇世界范圍最新研究資料。 歡迎掃描二維碼或訪問https://wx.zsxq.com/group/454854145828進入。
截止到2月28日 ”未來知識庫”精選的百部前沿科技趨勢報告
(加入未來知識庫,全部資料免費閱讀和下載)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.