文婷 發自 凹非寺量子位 | 公眾號 QbitAI
啥情況?統治科研圈幾十年的PDF格式,都需要因AI而“退休”…
因為以后論文的第一讀者不是人,而是AI??
![]()
近日,IEEE Spectrum重點關注了一項新研究——ARA(Agent-Native Research Artifact)。它不僅能讓AI理解研究結論,還能復現實驗、靈活規避失敗路線并繼續推進研究,讓AI從輔助工具升級為科研協作者
據IEEE報道,ARA團隊在一篇名為The Last Human-Written Paper: Agent-Native Research Artifacts的論文中,呼吁科學家們停止繼續使用PDF撰寫傳統論文,并表示:
- AI需要一種不同的內容格式,而AI的需求,理應被置于首位。
論文的第一作者劉嘉晨核心論點是:
- 一旦AI“榨干”了人類專家所有的數據,它就不再需要人類的任何輸入。到那時,AI將開始自主進化。
現在這些只提升AI科學家的能力,卻不改造科研知識的共享方式,就像在泥濘路上開F1賽車,難以復現并接續前人的工作。
PDF就是過去科研知識共享的最核心代表。
是時候了,ARA當立。
為什么PDF該死?
PDF代表的是傳統論文的最終結果,是科研最后成果的最終呈現,但就是這種呈現,“有問題”。
ARA團隊認為,真實的科研從來不是一條從問題直通答案的直線,研究者往往要提出十幾個假設、嘗試幾十種方案、調整無數次參數,在經歷大量失敗后,才能摸索出一條走得通的路徑。
然而,當這些探索被寫成論文時,那棵枝杈橫生的“探索樹”通常會被修剪成一條干凈、連貫的成功路徑。
ARA團隊將這種損失稱為“敘事稅”,即為了讓研究成為一個有頭有尾、邏輯自洽且成功的故事,大量的探索過程被主動舍棄,后來者只能被閃耀的新突破亮瞎眼,卻看不見前人踩過的坑、受過的罪。
![]()
除了“敘事稅”,傳統論文還存在著“工程稅”
一篇論文只要能讓審稿人信服,便算完成了使命。
但“說服審稿人”與“讓AI完整復現”完全是兩套標準。
模型版本、運行環境、超參數、預處理方式、訓練技巧……這些決定實驗成敗的關鍵細節,往往散落在正文、附錄和代碼倉庫中,有些甚至從未被記錄。
![]()
研究團隊統計了PaperBench中的8921項專家復現要求,發現僅有45.4%在論文PDF中得到了完整說明。
對咱來說,實驗信息少了,我們可以根據過往經驗、求助導師或者不斷試錯補上;
但對AI來說,論文里沒寫,那就意味著只能靠猜(或者瞎編),它也很無奈。
![]()
因此,ARA選擇徹底換一種思路:
- 不再將線性敘事的論文視為科研成果本身,而是把研究重組為一個機器可直接操作的知識包。
這個知識包包含四個層次:
- 科學邏輯層:
- 記錄研究解決了什么問題、為何采用該方法,以及哪些主張可被證偽。
- 可執行代碼層:
- 不僅提供代碼倉庫,還包含復現實驗所需的環境、配置與關鍵參數。
- 探索圖層:
- 將實驗過程還原為一張可追蹤的路線圖,成功與失敗的方向、放棄某條路線的原因均被保留。
- 證據層:
- 將論文中的每一項主張關聯至原始實驗結果,方便AI核驗結論,而非僅采信正文中的概括性描述。
概括來說,論文最后通過PDF呈現的只是“我們最后做成了什么”
但如果通過ARA,展現的還有“為什么這么做”“具體怎么做”“哪些方法已失敗”以及“原始證據在哪里”,追求的是知識優于敘事
更形而上來說,PDF只有結果,ARA還包括了整個過程。
道理似乎是這個么道理,但“一切存在皆合理”,PDF能成為人類科研論文最終呈現形式這么多年,一定是有其內在合理性的。
ARA要取而代之,需要的就不光是理念了。
ARA真的比PDF好用嗎?
為了讓ARA真正跑起來,研究團隊設計了三套配套機制:
- 1、Live Research Manager:負責在研究過程中持續記錄實驗、決策、轉向與失敗路線;
- 2、ARA Compiler:負責將現有的PDF和代碼倉庫轉換為ARA格式;
- 3、ARA原生審稿系統:負責讓機器先行完成結構檢查與復現驗證,并將創新性、重要性與研究品位等判斷留給人類審稿人。
為了體現ARA真的比PDF好用,研究團隊分別從理解復現延伸三個維度進行了測試。
![]()
在理解測試中,研究人員設置了450個問題,要求AI從ARA或傳統PDF加代碼倉庫中尋找答案。
結果顯示,使用ARA的AI準確率達93.7%,而傳統材料組僅為72.4%,相差21.3%
差距最大的是“復盤失敗”,當問題涉及失敗方案、替代路線和實驗教訓時,ARA組準確率為81.4%,傳統材料組僅15.7%——原因很簡單,傳統論文里壓根就沒有這些信息。
![]()
在復現測試中,團隊選取了15篇附帶GitHub倉庫的機器學習論文,設置了150項復現任務。
其中,ARA組的難度加權成功率為64.4%,傳統組為57.4%。且任務越難,ARA的優勢就越明顯
ARA在簡單、中等和困難三檔任務中,分別領先4.9%5.6%8.5%
但ARA的表現并非一路開掛。
在最具挑戰性的研究延伸環節,ARA組贏下了3項RE-Bench開放任務,但另有2項被傳統論文組反超。
![]()
不過,也有可取之處。
ARA組在全部5項任務中,都搶先摸到了那步最關鍵、最值錢的第一步實驗操作:利用失敗記錄迅速繞開已經被驗證過無效的研究方向,省去大量重復探索。
這也對應了論文中的另一組數據。在論文分析24008次AI Agent運行中,90.2%的資金成本都消耗在失敗探索上,而傳統論文幾乎不會保存這些失敗。
對劉嘉晨而言,這正是ARA最重要的價值。
![]()
在她設想的人機科研關系中,AI不再只是潤色論文、查找資料或生成代碼的輔助工具,而是能真正成為參與閱讀、復現和延伸研究的科研主體。
科研人員則可以更加聚焦于那些AI難以替代的判斷、創新和品味工作,即判斷問題是否重要、工作是否真正新穎、某條路線是否值得投入。
ARA也并非完美
不過,雖然ARA的成績單看起來非常亮眼,但它目前更像一位野心勃勃、天資聰穎卻根基尚淺的高一新生,才剛入學就想要在高考中考進北大。
它離成為“PDF終結者”還有很長的一段道路要走。
![]()
篇幅有限,簡單說三點。
ARA的第一個缺陷,就是它目前實驗的范圍較窄,普適性較弱,只覆蓋了天然適合代碼復現的機器學習領域,能否用于濕實驗或理論學科還尚未得到驗證。
第二個問題,就是隱私和數據安全問題。
ARA目前不僅還沒有實現細粒度的訪問控制,缺少沙箱執行和內容異常檢測,相關規則和標準也還沒完善妥當。
要是你就這么大大咧咧地把機密數據喂給它,小心下一秒就被你的競爭對手拿走哦。
![]()
第三個是不可避免的AI幻覺和路徑依賴問題。
在15篇論文的復現實驗中,傳統材料組出現了2次結果編造,ARA組也出現了1次。
所以它目前應該既不能保證AI永遠不捏造結果、也不能保證它不會過度傻白甜地相信前人的判斷。
![]()
當然,這種思考和理念,依然有其創新性和價值。
如果你需要更詳細了解,建議你直接前往文末附上的論文和開源地址。
或者更進一步與ARA的研究團隊、提出者交流。
ARA提出者
ARA研究由來自斯坦福大學、密歇根大學、卡內基梅隆大學和MIT等多家機構的37名研究者共同完成。
其中第一作者是劉嘉晨
她是密歇根大學的計算機科學博士,深耕機器學習系統與大模型基礎設施領域。
![]()
劉嘉晨,來源IEEE Spectrum
她曾參與大模型服務、訓練系統和Agentic RL系統研究,也曾在Meta從事大模型預訓練與后訓練基礎設施相關工作。
劉嘉晨的個人主頁和密歇根大學官網顯示,她曾在2023年入選Machine Learning and Systems Rising Stars榮譽榜單。
圖源密歇根大學官網
![]()
今年5月,劉嘉晨在帕洛阿爾托創立Agent-Native Research Lab,已經聯動產學研來推動ARA Commons科研生態建設。目前,其公開成果主要包括ARA協議及論文、配套代碼、研究生態構想,以及面向NeurIPS 2026的AI驅動科研生態研討會。
實際上,這種Agent-Native的理念,也在AI狂飆這幾年,正在給千行百業帶來范式變革。
從PDF到ARA,一方面是AI能力的涌現,可以讓整個科研過程的價值被重新發現和重視,而不僅僅是呈現一個最終的結果。
過去我們形成了PDF,是因為所有論文都是人類作為閱讀者、使用者、核心對象。
但現在AI能力加持,Agent能力突破,人類看不過來的科研過程Agent可以看,人類難以并行的科研復現Agent可以復現……
以前是人類—PDF—人類,以后可能是人類—Agent—ARA—Agent—人類
這種變革也不局限于科研領域,在更早之前,一脈源流的已經有:
GUI已死,CLI當立…
Markdown已死,HTML當立…
Prompt已死,Loop當立…
“PDF已死,ARA當立”
只是這種趨勢下的一種因循結果罷了。
這更本質的是一種AI觀、價值觀上的哲學體現,你依然支持的是“人是萬物的尺度”,還是AI才是更終極的尺度?
你是碳基生命守護者,還是完全擁抱硅基時代降臨…
這無關對錯,只是選擇,選擇的人多了,也就會在某個節點分出對錯。
而ARA的提出者,顯然選擇的是AI為中心、Agent Native。
當然,目前為止,ARA這篇研究和論文,依然是PDF提交和呈現的。
[1]https://spectrum.ieee.org/ai-scientist-research-paper-format?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-08-06&itm_content=hero1
[2]https://arxiv.org/abs/2604.24658
[3]https://amberljc.github.io/
[4]https://micl.engin.umich.edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars
[5]https://github.com/ARA-Labs/Agent-Native-Research-Artifact
[6]https://the-future-of-research-ecosystem.github.io/
[7]https://www.agenticresearch.sh/
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.