![]()
新智元報道
![]()
當大模型逐漸掌握對話、推理、編程和工具調用之后,自主研究被視為人工智能領域的「The Next Big Thing」。
自主研究意義在于,AI的發展將不再受制于人類知識邊界,形成一種面向智能生產的全新Scaling Law——「投入多少能源,就將轉化多少智力」。自主研究正是衡量智能體自主研究能力重要維度之一。
普通問答只需要定位一個事實,而自主研究面對的是一組相互關聯、彼此制約的條件。智能體不僅要從龐大的信息空間中定位候選答案,還需整合分散甚至沖突的證據,并確認最終答案滿足全部關鍵約束——只要有一項未驗證,答案即為無效解。自主研究的核心難題并不是「搜索得還不夠久或者證據難找」,而是:
智能體能不能知道當前答案到底已經成立了什么、還缺什么,以及下一步最應該研究什么,是如何讓智能體在復雜約束中持續接近正確答案。
智源研究院發布的AREX正是圍繞這一核心問題提出的。它抓住了自主研究中的關鍵突破口——「發現—驗證不對稱性」:完整答案往往難以一次性生成,但一旦形成候選解,便可以通過針對關鍵約束的逐項驗證,快速定位不足并指導后續探索。
驗證的意義并非僅僅判斷答案是否正確,更重要的是幫助智能體理解「已經知道什么、還缺少什么,以及下一步應該研究什么」,從而讓每一輪研究都更加精準、更具方向性。
這一思想的前瞻性在Jeff Dean近日創立的Discovery Loop公司得到印證:未來的人工智能不僅需要更強的推理能力,更需要通過持續的實驗、反饋和修正形成自主發現能力。
AREX對「求解—驗證」雙循環的探索,體現了智源研究團隊在自主研究方向上的前瞻性,也反映出通過閉環迭代推動智能持續進化,正在成為人工智能發展的重要趨勢。
項目主頁:
https://vectorspacelab.github.io/arex-model/
模型權重:
https://huggingface.co/collections/BAAI/arex
體驗鏈接:
https://arex-research.com
AREX旨在訓練能長期運行、
自我驗證、持續修正的研究型智能體
AREX的目標,不是讓模型在單輪回答中寫出一個「看起來更完整」的答案,而是訓練一種能長期運行、持續驗證、遞歸修正的自主研究智能體——不是一次性給出答案,而是在「研究→驗證→再研究」的循環中不斷接近完整解,讓模型真正具備持續改進當前解的能力。
面對復雜任務,智能體可以先給出一個階段性答案;隨后,它會逐項檢查約束是否滿足,保留已經驗證的證據,定位尚未解決的主張,再發起更有針對性的后續研究。當新的證據到來后,智能體會再次更新答案、重新驗證,并判斷是繼續深入,還是結束研究并輸出最終結論。
這一過程可以遞歸執行多輪:研究→暫定答案→逐項驗證→定位缺口→定向研究→更新答案。這里的「自我改進」,并不是指模型在執行任務時在線更新參數,而是指智能體對自身研究狀態和當前答案進行持續修正。
它不再只是一個「搜索后回答」的工具,而更像一個會反復檢查研究進度、修正研究路徑、沉淀有效證據的研究助手。AREX通過雙循環框架打通「找到答案」與「改進答案」的閉環AREX的整體方法,可以概括為一套雙循環遞歸求解框架。內層循環負責「研究」,外層循環負責「改進」。
二者協同,讓智能體不只是向前搜索,而是在每一輪中繼承已有進展、修正錯誤方向,并不斷接近更可靠的答案。
![]()
內層循環Research Loop:內層循環負責完成一輪相對完整的研究。在這一階段,智能體會圍繞當前研究問題搜索信息、調用工具、收集證據、比較候選,并構造一個暫定答案。它的目標不是一次性得到終局解,而是形成一個結構完整、證據可追蹤、后續可以被審計的當前解。
如果這是第一輪研究,智能體面對的是用戶提出的原始問題。如果已經經過外層驗證,那么它面對的就是一個被重新定義過、更聚焦的新問題。例如:補齊某項缺失證據,消解兩個來源之間的矛盾,或者替換一個無法滿足全部條件的候選答案。這意味著,每一輪研究都不是簡單重復,而是在更清晰的問題上繼續推進。
外層循環Self-Improvement Loop:外層循環負責判斷當前答案究竟走到了哪一步。AREX會依據任務中的各項約束,對暫定答案進行逐項審計,并形成約束級別的置信判斷:哪些條件已經獲得充分支持,哪些仍然不確定,哪些關鍵主張缺少證據,哪些結論需要重新研究。
如果所有必要條件都得到足夠支持,智能體就結束研究并輸出答案。如果仍有條件沒有解決,驗證結果就會被轉化為下一輪內層循環的研究目標。因此,外層循環不是簡單地說「答案還不夠好,再試一次」,而是明確告訴內層循環:已經解決了什么,接下來只需要解決什么。這讓每一輪遞歸都能繼承已有成果,而不是從頭開始。
機制分析:
長程研究狀態維護帶來的性能提升
AREX的推理機制包含兩個循環:內層研究循環負責搜索、訪問網頁、驗證證據、更新上下文并生成暫定答案;外層自我改進循環根據答案、證據和置信度,決定接受、繼續細化或重新開始。
其中,自主上下文更新(ACU)是關鍵。它不是普通摘要,而是面向下一步行動的研究狀態:保留已驗證發現、已排除候選、未解決約束和下一步計劃。BrowseComp上的分析顯示,AREX通常會主動更新上下文,而不是等到128K上下文窗口被塞滿后才被動壓縮。
受控實驗顯示,AREX完整系統在BrowseComp上達到82.5,比關閉ACU和外層循環的版本高出22.9個百分點。訓練消融也表明,漸進式多輪能力訓練、關鍵步驟聚焦監督和步驟感知強化學習分別貢獻于工具交互、關鍵決策和長程策略優化。
![]()
![]()
訓練消融進一步說明,AREX的提升來自多個環節共同作用。漸進式多輪能力訓練先建立穩定的工具交互能力,關鍵步驟聚焦監督把訓練信號集中到證據發現、路徑否定與重定向、關鍵上下文更新等轉折點,步驟感知強化學習則繼續優化長程決策策略。
這也解釋了AREX的核心思想:長程研究中真正難的不是例行搜索和訪問網頁,而是在關鍵時刻做對決定,什么時候相信一個證據,什么時候放棄一個候選,什么時候重整上下文并改變搜索方向,這些才是決定研究成敗的步驟。
AREX讓自主研究智能體
在長程任務中持續自我進化
長程研究不「失憶」:將「歷史包袱」轉化為「進度路標」。長程研究中的核心挑戰,并不只是信息檢索是否充分,更在于模型能否在持續延展的研究過程中穩定記住當前進展。隨著交互軌跡不斷變長,歷史記錄中會同時包含已驗證的證據、被推翻的假設、中途放棄的計劃以及大量重復信息。全盤保留這些內容容易讓模型迷失方向,而簡單截斷又可能丟掉關鍵線索。
AREX的做法,是讓模型在研究過程中主動調用上下文更新工具,將不斷增長的交互歷史整理成一個可以繼續推進的研究狀態。這種更新并不是普通摘要,而是一份「研究進度表」,幫助模型明確:當前研究到哪了?什么已經成立?什么已經被排除?接下來最該查什么?通過這種方式,模型能夠持續繼承有效信息、壓縮冗余內容,并在當前階段形成更穩健的最優解。
構造可驗證的訓練數據:從確定答案出發,生成可驗證的研究軌跡。自我改進不是靠延長搜索軌跡就能堆砌出來的。AREX需要的是那種能真正教會模型如何發現線索、交叉驗證、推翻錯誤候選、調整方向并繼續前進的數據。
為此,AREX設計了一套可驗證的自主研究任務生成方法:先從一個確定的實體答案出發,圍繞它構造一組必須被真實證據支撐的約束條件,然后再把這些約束改寫為無法通過關鍵詞直接命中的開放式問題。這樣生成的任務,迫使模型必須真正去搜索、比對和驗證,而不是在文本表述里「找答案」。
隨后,強教師模型在同樣工具環境中完整執行這些任務,留下全過程的研究軌跡。但凡出現直接猜答案、忽略觀察、證據不足或結論與證據矛盾等情況,整條軌跡都會被剔除。最終保留下來的,是從不確定候選逐步走向可驗證答案的研究軌跡。
分階段訓練與關鍵步驟強化:使模型掌握自我改進的連貫策略。在獲得高質量訓練數據之后,訓練順序同樣關鍵。AREX沒有將所有軌跡簡單混合訓練,而是采取了分階段策略。模型首先學習多輪工具調用和證據獲取的基本能力,再逐步進階到長鏈推理、候選比較和困難問題求解。同時,AREX還會鞏固論文研究、高難知識推理等專項能力,避免不同任務之間的能力相互干擾。
AREX也不會把長軌跡中的每一步都同等對待。真正決定研究是否能夠取得突破的,往往是少數關鍵轉折點,例如找到關鍵證據、否定錯誤候選、切換搜索方向,以及更新研究狀態。這些關鍵步驟會在訓練中被重點關注,并在強化學習階段繼續優化模型的研究策略。
因此,AREX的自我改進能力并不是「多搜幾輪」自然涌現的結果,而是由可驗證任務設計、高質量軌跡篩選、分階段訓練和關鍵步驟強化共同塑造出來的。它的目標是讓智能體更接近真正的研究者:能夠判斷何時堅持當前方向,何時及時掉頭,何時停下來確認答案。
實驗評估:
AREX以10B激活參數達到自主研究前沿水平
為了驗證AREX是否具備真實自主研究能力,智源研究院在六個基準上進行了評測,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它們分別覆蓋信息深度、信息廣度、深度與廣度結合,以及端到端 Agent能力。
![]()
信息深度:在多跳信息中持續挖掘
BrowseComp和xbench-2510的任務設計頗為苛刻:問題往往嵌入了多個相互約束的條件,正確答案隱藏在分散的網頁與間接證據之中,模型需要沿著線索逐級深入挖掘。AREX-Base在BrowseComp上達到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同時超過GLM-5與Qwen3.5-397B。
在xbench-2510 上,它接近MiroThinker-H1,并優于Qwen3.5-397B與DeepSeek-V4-Flash。結果表明,AREX能力提升并非來自更多輪次的搜索堆砌,而是源于更穩定的研究狀態維護——模型能夠保留已驗證信息、排除錯誤候選,并持續圍繞尚未解決的約束推進。
信息廣度:在大規模信息空間中全面覆蓋
WideSearch-en考察的是另一項能力:在大規模搜索空間中盡可能完整地找到目標條目,并完成去重、核驗與匯總。AREX-Base在該基準上取得了82.0 Item-F1,為論文對比范圍內的最高結果,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。結果表明,AREX不只擅長「挖深一個答案」,也能管理大范圍搜索任務,在長程檢索中持續維護已覆蓋范圍和剩余空白。
深度與廣度的結合:可遷移的研究方法論
DeepSearchQA同時要求多步檢索、證據推理與答案完整性,是深度與廣度的綜合測試。AREX-Base在這里取得了89.9 F1,超過GPT-5.4與DeepSeek-V4-Pro和Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。這說明AREX學到的不是某個特定領域的搜索技巧,而是一套可遷移的研究方法論:檢索、比較、驗證、修正、聚合。
端到端能力:從搜索到完整研究流程
GAIA和HLE with tools進一步要求模型將搜索與規劃、推理、工具調用結合起來。AREX-Base在三項測試上分別取得85.4、71.0和52.4。在GAIA上,它超過Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集測評下,它超過GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。這說明AREX的能力可以從搜索任務遷移到完整智能體工作流:模型不僅能找到信息,還能規劃行動、調用工具、驗證中間結論,并組織最終答案。
總體性能對比:開源前沿、閉源旗艦與同量級模型
與開源前沿模型相比,AREX-Base在雙方均報告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部領先。與DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。
與Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上領先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。測評結果顯示AREX不是「所有單項都領先」,而是以10B激活參數,在深搜、廣搜、端到端智能體和工具推理之間取得了均衡的綜合競爭力。
與閉源旗艦模型相比,面對GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等閉源旗艦,AREX-Base同樣進入多個高難度基準的競爭區間。它在BrowseComp上與GPT-5.4幾乎持平,在DeepSearchQA上超過GPT-5.4,在WideSearch-en上超過GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。這表明AREX已經能夠在關鍵自主研究任務上與閉源旗艦模型正面競爭,尤其在大范圍信息覆蓋任務中優勢更明顯。
與同量級基礎模型與智能體模型相比,AREX-Base的總參數量為122B,每次推理僅激活10B參數。相比同總參數量的Qwen3.5-122B,AREX-Base在雙方均報告的指標上全部提升;相比更大規模的Qwen3.5-397B,AREX-Base在六項完整可比基準上全部領先。與專門面向搜索和研究任務訓練的智能體模型相比,AREX也體現出較高的參數效率。
AREX-Turbo只有4B參數,但在多項指標上超過Qwen3.5-35B、Quest-35B和Tongyi-DeepResearch-30B;AREX-Base則在DeepSearchQA和HLE文本子集上超過MiroThinker-H1,并在xbench-2510上與其接近。這說明自主研究能力并不只來自擴大參數規模,也來自對長程研究過程的專門訓練。
AREX研究平臺:
將自主研究能力封裝為日常研究工具
AREX LLMs解決的是智能體如何開展長期、可靠的自主研究,而AREX Research Platform在此基礎上,將這一能力封裝為面向科研與產業用戶的日常研究工具。
學術與產業界每天都會產生大量新增信息——論文、技術報告、會議talk、開源發布與行業分析。而當前的信息分發機制多以發布時間或熱度作為排序維度,而非依據用戶的具體研究關注點進行組織。高價值信息被碎片化地呈現,使用者往往需要在多個來源之間自行拼接背景,信息獲取成本高、效率低。
AREX平臺以模型驅動的內容獲取與研究智能體為核心,針對三類不同的信息形態提供獨立入口:資訊持續追蹤指定領域內的每日動態,論文篩選高關注度的研究工作并支持深度理解,播客從長時段訪談中提取關鍵觀點與行業趨勢。三者均由AREX智能體驅動,既支持廣域瀏覽,也支持針對細分方向的定制化配置。
![]()
AREX首頁(最終效果以上線版本為準)
定制化資訊服務:在信息組織方式上,AREX平臺支持用戶指定關注方向(如Coding Agent、芯片行業進展等),并據此生成持續運行的專屬資訊智能體,按設定頻率完成檢索、篩選與匯總。
與傳統「源訂閱」相比,這一機制以「用戶關注點」作為過濾維度,使信息流由「按熱度排序」轉向「按相關性組織」,從而降低無關信息干擾,提升信息獲取的針對性。
![]()
AREX資訊定制
自由的可擴展性:此外,AREX平臺在信息發現與自主研究之間提供直接銜接。每條資訊、論文或播客旁均提供自主研究入口,可一鍵調用AREX智能體。
智能體已感知當前閱讀內容與上下文,無需重復交代背景,即可針對具體問題(例如「該方向是否有后續討論」、「所選benchmark是否權威」、「相關觀點在其他訪談中是否出現過」)啟動檢索、對比、分析與綜合,輸出完整的知識脈絡。
![]()
聊一聊
平臺承擔內容發現,智能體承擔理解與分析,二者在統一上下文下銜接。這一設計是AREX區別于單純資訊工具的核心所在。
當前版本的AREX Research Platform覆蓋科研工作流中的「信息獲取」與「認知構建」兩個階段,即幫助用戶發現相關信息并理解其研究背景。智源研究院后續將能力延伸至研究執行階段,由提供參考信息進一步發展為支持方案產出。
重點方向是端到端自主科研,包含以下三個環節:方案設計——智能體在理解問題與現有方法后,自主提出創新方案、實驗設計、對比策略;工程實現——智能體直接生成可運行的代碼框架、訓練配置、評估腳本,并接入計算資源執行;性能調優——智能體分析實驗結果,識別瓶頸,自動迭代超參、調整結構,持續優化迭代。
最終實現:用戶定義研究問題,由AREX自主完成探索、實驗與優化,并交付可驗證的研究結果。
AREX當前已開放BETA版測試,歡迎大家體驗并反饋:arex-research.com
編輯:桃子
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.