我們總說模型“忘性大”,上下文一長就開始迷糊,前面說過的話后面不認賬,長任務里更是頻繁走丟。這個現象在認知科學里有個特別貼切的概念,叫做元記憶。意思是人類不僅靠記憶本身,還靠一套關于記憶的策略,知道什么時候該記,記什么,怎么整理,什么時候該翻出來用。
如果把這個視角放到 LLM 身上,你會發現它們的瓶頸幾乎一模一樣。上下文窗口就像人類的短時記憶,容量有限,信息一多就溢出。長任務里,信息延遲特別嚴重,前面一個細節沒記好,幾百步之后就可能導致徹底迷路。傳統的外部記憶,比如向量庫、檢索系統、summary buffer,其實都是固定機制,模型只能被動使用,完全談不上“學習如何記憶”。
這正是 AUTOMEM 想解決的問題。研究團隊來自斯坦福大學,包括 Shengguang Wu、Hao Zhu、Yuhui Zhang、Xiaohan Wang 和 Serena Yeung-Levy。他們提出一個大膽的想法,讓 LLM 像人類一樣,把記憶管理當成一種可以訓練的認知技能,讓模型自己決定記什么、怎么記、什么時候讀、怎么讀。項目主頁在 autolearnmem.github.io,可以看到完整的框架圖和實驗結果。
這項研究的核心理念非常明確。記憶不應該是固定模塊,而應該是一種可以不斷練習、不斷變強的技能。模型應該像一個真正的智能體那樣,擁有自己的記憶策略,而不是被動依賴工程師給它塞的工具。
項目地址:https://autolearnmem.github.io/
01 研究問題
為什么記憶管理必須成為一種可學習的技能?原因其實很現實。長任務的軌跡往往是上萬步級別的,信息在其中不斷流動、不斷變化。一個記憶錯誤可能在幾百步之后才顯現出來,等你發現問題時,模型已經在錯誤的路徑上走了很久。
更麻煩的是,這些軌跡幾乎無法人工審查。你讓一個人去看一萬步的代理日志,找出哪一步記錯了、哪一步沒記、哪一步寫重復了,這幾乎是不可能完成的任務。更別說每次修改之后還要重新跑實驗、重新審查。
這就引出了一個關鍵問題。模型能不能自己學會管理記憶?能不能自動優化記憶結構,讓文件系統更合理?能不能自動提升記憶熟練度,讓模型在正確的時間做正確的記憶操作?
AUTOMEM 的答案是肯定的。它用一個更強的 meta-LLM 來審查軌跡,讓模型自己學會如何記憶,把記憶管理變成一種可訓練的能力。
![]()
圖1:使用Qwen2.5-32B-Instruct優化記憶技能。從配備文件系統內存(v0)的基礎代理開始,AUTOMEM通過內存支架優化(v0–v5/v4/v2)逐步提高性能,然后進行內存熟練度訓練(+train),在優化的支架上進一步提高性能。
02 AUTOMEM的核心思想
AUTOMEM 的核心思想其實很樸素,把文件系統當成模型的外部記憶,讓模型可以像操作游戲動作一樣操作文件。也就是說,模型的動作空間里不僅有“向北走”“攻擊怪物”,還會出現“寫入 dungeon_map.txt”“搜索 inventory.txt”“追加 monster_log.txt”。
這種設計讓記憶行為變得透明。每一次讀寫都是顯式動作,軌跡里清清楚楚地記錄下來。meta-LLM 可以完整審查這些軌跡,找出記憶結構的問題,找出記憶決策的錯誤,然后自動優化。
內層代理的每一步都包含兩個例行程序。一個叫 LOG,用來記錄剛發生的事情,比如怪物攻擊、地圖坐標、物品變化。另一個叫 PLAN,用來決定下一步行動,包括搜索文件、讀取文件尾部、查找關鍵字,然后再做出游戲動作。
![]()
圖2:用于評估記憶技能的長期游戲環境。這三種環境都是隨機世界,使每一集都是獨一無二的,并最大限度地減少了預訓練知識的影響。Crafter是一款具有制作、戰斗和資源管理的開放世界生存游戲。MiniHack在NetHack引擎中提供了專注的謎題、導航和戰斗任務。NetHack是最復雜的游戲之一:劇集跨度104-105回合,探索空間廣闊,人類玩家通常需要數年時間才能掌握。
這種設計帶來了一個關鍵轉變。記憶不再是固定模塊,而是可學習行為。模型可以自己決定什么時候寫、寫到哪里、寫什么格式,也可以自己決定什么時候讀、讀哪個文件、讀哪一段。記憶管理變成一種可以不斷優化的技能,而不是工程師硬塞給模型的工具。
更重要的是,這種透明的記憶行為讓自動化優化成為可能。meta-LLM 可以像代碼審查者一樣,逐步改進記憶結構,讓模型的記憶越來越清晰、越來越高效。
03 記憶技能的兩條改進軸線:結構與熟練度
當研究團隊把“記憶”從一個固定模塊重新定義成一種可以訓練的技能時,整個問題的結構就變得清晰了。記憶不是單一維度的,它有兩個互補的方向,一個是結構,一個是熟練度。結構決定模型能做什么,熟練度決定模型做得好不好。
![]()
圖3:AUTOMEM概述。兩個自動外循環優化了使用文件系統作為內存的共享內環代理。外循環(頂部):元LLM審查完整的劇集跟蹤,并迭代地修改代理支架。外循環(底部):一個元LLM訓練引擎聯合協調數據管理和微調配置,以訓練一個專門處理內存操作的內存專家,而任務模型(凍結、未修改)則提交任務操作。這兩個循環是互補的:循環產生一個優化的支架,循環在支架內訓練模型,使其更有效地與內存交互。
所謂結構,就是模型與外部記憶之間的那套“腳手架”。包括文件格式怎么設計,提示詞怎么寫,動作詞匯怎么定義,文件命名怎么規范,文件之間的組織關系怎么安排,搜索邏輯和寫入邏輯怎么約束。這些東西聽起來像工程細節,但在長任務里,它們就是模型的“記憶器官”。如果結構混亂,模型的記憶就會像堆滿重復紙條的抽屜,越用越亂。
熟練度則是另一回事。結構給了模型一套工具,但模型能不能用好這些工具,是完全不同的能力。什么時候該寫,什么時候該讀,寫到哪個文件,讀哪一段,是否需要去重,是否需要合并,這些都是決策問題。模型必須在任務過程中不斷做出判斷,而這些判斷的質量決定了記憶是否真正發揮作用。
研究把這兩個方向拆開來處理,先優化結構,再訓練熟練度。結構是地基,熟練度是技巧。只有兩者疊加,記憶才能真正成為一種可用的能力。
04 外層循環一:自動化記憶結構優化
當結構被視為地基,問題就變成如何自動化地改進這套地基。研究團隊的做法非常大膽,他們讓一個更強的 meta-LLM 來審查完整的任務軌跡。不是看幾步,而是看上萬步。每一次讀寫,每一個文件的變化,每一個提示詞的觸發,都被完整記錄下來,交給 meta-LLM 逐條分析。
meta-LLM 的角色更像一個代碼審查者。它會找出結構性問題,比如地圖文件越寫越大,重復坐標堆成一座山,導致模型后面根本找不到有用的信息。它會發現怪物記錄格式混亂,模型讀的時候經常讀不到關鍵字段。它會指出搜索邏輯太寬泛,模型頻繁做空搜索,浪費大量步驟。它也會提醒寫入邏輯缺乏合并機制,導致文件不斷膨脹。
這些問題不是人工能輕易發現的,因為軌跡太長,信息太多,延遲太大。meta-LLM 的優勢就在于它能一次性讀完所有內容,并且能提出結構性的修改建議。比如地圖文件改成坐標鍵值對格式,自動去重。怪物記錄改成統一字段格式。搜索邏輯加入過濾條件。寫入邏輯加入合并策略。
每一次修改之后,團隊都會用固定種子重新跑實驗。如果性能提升,就保留修改。如果沒有提升,就回滾。經過多輪迭代,Crafter 收斂到 v5,MiniHack收斂到 v4,NetHack 收斂到 v2。這些版本的結構已經足夠干凈、足夠合理,模型可以在其中更高效地管理記憶。
更驚人的是,這一切都沒有改模型權重。僅靠結構優化,性能就能提升兩到四倍。這說明記憶結構本身就是長任務的關鍵瓶頸之一。
05 外層循環二:記憶熟練度訓練
當結構優化到位之后,瓶頸就轉移到模型的記憶決策能力上。結構給了模型一套好用的工具,但模型能不能用好這些工具,是另一回事。于是第二個外層循環開始運作。
meta-LLM 在這里扮演訓練引擎的角色。它會從大量軌跡中篩選出“好的記憶操作”,比如正確的寫入、有效的搜索、合理的文件組織。它不會生成新數據,而是從模型自己的行為中挑選值得強化的部分。然后它會構建訓練數據,自動選擇 LoRA 配置,微調一個專門的“記憶專家模型”。
推理時,系統會同時運行兩個模型。記憶專家負責 LOG 和 PLAN 中的記憶操作,游戲模型負責最終動作決策。兩者共享同一段對話歷史,但職責完全不同。記憶專家專注于記憶,游戲模型專注于行動。
這種雙模型協作有幾個明顯優勢。第一,不會破壞原有任務能力,因為游戲模型的權重完全不動。第二,記憶能力可以疊加在結構優化之上,形成雙重提升。第三,訓練信號更純粹,因為記憶專家只學習記憶相關的行為,不會被動作格式干擾。
最終的結果是,熟練度訓練帶來了額外的九到十八個百分點的提升。雖然看起來沒有結構優化那么夸張,但它是結構優化之后的關鍵補強。沒有熟練度訓練,模型的記憶行為仍然會出現大量低效決策。
這也讓研究得出一個重要結論。記憶熟練度是結構優化之后的第二個瓶頸。只有突破這個瓶頸,記憶技能才能真正成熟。
06 實驗與結果:記憶技能的巨大杠桿效應
當研究團隊把記憶當成一種可以訓練的技能之后,他們必須回答一個最關鍵的問題。這樣的記憶技能到底能不能在真實環境里發揮作用。于是他們把 AUTOMEM 丟進三個公認的長任務地獄場景里,讓它和各種大模型一起比拼生存能力。
第一個環境叫 Crafter,是一個開放世界的生存游戲。模型要采集資源,要制作工具,要打怪,要建造,任務鏈又長又亂,完全是記憶的噩夢。第二個環境叫 MiniHack,是 NetHack 的輕量版,包含迷宮、戰斗、推箱子等任務,步數不多但結構復雜。第三個環境就是臭名昭著的 NetHack,全世界 AI 研究者公認的長任務終極考場,動輒上萬步,地圖隨機,怪物隨機,物品隨機,人類都要練幾年才能玩得順。
為了衡量模型的表現,研究用了 progression rate 指標。簡單說,就是模型在任務里走了多遠,完成了多少目標,推進了多少層級。這個指標被壓縮到百分制,方便比較。
結果非常驚人。僅靠結構優化,模型的表現就能提升兩到四倍。Crafter 從二十多分直接跳到四十多分。MiniHack 從個位數跳到二十多分。NetHack 雖然絕對值不高,但提升幅度同樣巨大。更夸張的是,優化后的三十二億參數模型,居然逼近甚至超過七十二億參數的同家族模型。也就是說,記憶結構的優化比模型規模更有用。
![]()
圖4:支架優化對游戲和記憶行為的影響(v0→ 工匠v5,v0→ v4 for MiniHack,v0→ v2 for NetHack)。左:在所有三種環境中,非生產性游戲動作率(卡住或振蕩的步驟比例)下降了32-65%。右側三個面板:內存操作變得更加高效和更有針對性——冗余寫入急劇下降(-68%至-83%),空搜索率(內存搜索不返回任何內容)下降(-13%至-83%?50%),隨著更精簡的內存壓縮模型必須處理的內容,每一步的輸入上下文會縮小(?3到?30%)。所有值都是v0與最終支架版本的比較;在每個面板中,越低越好。
![]()
圖5:內存文件演化示例(NetHack)。基本模式(v0)記錄到一個無邊界的、僅可追加的dugeon_map.txt,該文本會累積重復的坐標條目。腳手架優化用協調鍵控的<|UPSERT_MAP|>重復數據消除格式取代了這一點,添加了根據觀察維護的自動同步庫存和狀態文件,并預先填充了策略參考。
當記憶熟練度訓練疊加上去之后,表現再次提升。Crafter 再漲幾個百分點,MiniHack 再漲幾個百分點,NetHack 也穩穩往上走。最終的成績已經接近 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 這樣的前沿閉源模型。
這說明一個非常重要的事實。記憶管理是長任務里最高杠桿的能力。模型規模當然重要,但在長任務里,記憶結構和記憶熟練度的作用遠遠超過單純堆參數。
07 行為分析:記憶結構優化如何改善任務行為
研究不僅看最終成績,還深入分析了模型的行為變化。因為記憶結構優化不僅讓模型記得更好,還讓模型行動更聰明。
第一個變化是無效動作顯著減少。所謂無效動作,就是模型原地踏步或者來回搖擺,完全不知道自己在干什么。優化之后,這類動作減少了三成到六成。模型不再迷路,不再瞎走,行動變得更有方向。
第二個變化是重復寫入大幅減少。優化前,模型經常把同樣的坐標、同樣的怪物信息反復寫進文件,導致文件越寫越大。優化后,重復寫入減少了六成到八成。文件變得更干凈,模型讀起來也更輕松。
第三個變化是空搜索減少。模型以前經常搜索不到任何結果,浪費大量步驟。優化后,空搜索減少了大約一到五成。說明搜索邏輯變得更精準,模型不再盲目查找。
第四個變化是每步輸入 token 數減少。因為文件結構更緊湊,模型每一步要讀的內容變少,輸入 token 下降了三到三成不等。輸入越少,模型越容易集中注意力,推理也更穩定。
![]()
圖6:兩個優化階段的定性行為。每一行都是一個環境;它的三個細胞顯示了基礎支架v0、進化支架和+訓練專家在代表性評估事件中的表現。每個單元格下的注釋報告了試劑的行為及其進展速度(prog.);對于NetHack,它還列出了地牢級別(Dlvl,代理的深度)和經驗級別和點數(Xp)。工匠:基劑只采集木材;進化的腳手架可以制作石器、建造爐子和開采鐵;受過訓練的專家在養活自己的同時達到了同樣的制作水平(9→55→59%的進步)。MiniHack Corridor-R3,一項需要導航分支走廊才能到達目標樓梯的任務:無論是基礎還是進化的腳手架都無法到達樓梯,而訓練有素的專家可以解決這項任務(0→0→100%)。NetHack:基礎代理在經驗級別1時,在幾百步內死亡;進化的支架得以幸存。
這些行為變化說明一個簡單但重要的事實。更好的記憶結構不僅讓模型記得更好,還讓模型行動更有效率。記憶和行動是同一個動作空間里的兩個側面,結構優化會同時改善兩者。
08 邁向認知型LLM代理
當我們把這些結果放回認知科學的框架里,會發現 AUTOMEM 做的事情其實非常接近人類的元記憶。人類不是靠死記硬背,而是靠一套關于記憶的策略。知道什么時候記,知道怎么記,知道什么時候該翻出來用。AUTOMEM 讓模型也具備了類似的能力。
從 AI 系統的角度看,meta-LLM 審查軌跡是一種全新的自動化優化范式。以前我們只能靠人工寫規則,靠工程師調結構,現在可以讓一個更強的模型來審查一個弱模型的行為,自動提出修改建議,自動優化結構,自動篩選訓練數據。這是一種非常強大的系統能力。
從長任務代理的角度看,記憶管理是突破瓶頸的關鍵。上下文窗口再大也有極限,模型規模再大也會迷路。只有記憶結構和記憶熟練度能真正解決長任務里的信息延遲問題。
未來的方向非常廣闊。記憶技能可以和多智能體系統結合,讓多個代理共享記憶。可以和智能合約、數字經濟代理結合,讓模型在復雜經濟環境里保持長期策略。可以和 Agentic Web、Atomic Memory 框架融合,讓模型在互聯網環境里擁有可成長的記憶體系。最終形成一種具備可學習記憶的自主代理,能夠在長任務里持續成長、持續優化、持續變強。
這就是 AUTOMEM 的真正意義。它不是一個記憶模塊,而是一種讓模型擁有“記憶智慧”的方法。它讓模型從被動使用工具,變成主動管理記憶。它讓模型從短時推理機器,變成具備長期認知能力的智能體。(END)
參考資料:https://arxiv.org/abs/2607.01224
![]()
親愛的人工智能研究者,為了確保您不會錯過*波動智能*的最新推送,請星標*波動智能*。我們傾心打造并精選每篇內容,只為為您帶來啟發和深思,希望能成為您理性思考路上的伙伴!
加入AI交流群請掃碼加微信
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.