![]()
讀完一篇論文,不等于理解一篇論文。
能總結(jié)摘要,也不等于能回答圍繞方法設(shè)計(jì)、實(shí)驗(yàn)結(jié)果和結(jié)論依據(jù)的具體問(wèn)題。
科研場(chǎng)景里的論文閱讀,通常不是只問(wèn)“這篇文章講了什么”。更常見(jiàn)的問(wèn)題是:
- 這個(gè)方法為什么這樣設(shè)計(jì)?
- 和已有方法相比,差異到底在哪里?
- 實(shí)驗(yàn)設(shè)置是否足以支撐結(jié)論?
- 表格里的結(jié)果說(shuō)明了什么?
- 作者提出的 claim,是否真的能從論文證據(jù)中得到支持?
RPC-Bench關(guān)注的正是這類(lèi)能力:模型能否充分理解論文內(nèi)容并給出可靠回答。不同于直接用大語(yǔ)言模型(LLM)從正文合成問(wèn)題,RPC-Bench從真實(shí)review-rebuttal互動(dòng)中構(gòu)造QA。審稿人與作者圍繞論文貢獻(xiàn)、問(wèn)題和證據(jù)鏈展開(kāi)討論,這些內(nèi)容更貼近科研人員實(shí)際關(guān)心的論文理解問(wèn)題。
![]()
論文: https://arxiv.org/abs/2601.14289
GitHub: https://github.com/zai-org/RPC-Bench
項(xiàng)目主頁(yè): https://rpc-bench.github.io/
HF dataset: https://huggingface.co/datasets/zai-org/RPC-Bench
RPC-Bench做了什么?
RPC-Bench是一個(gè)面向研究論文理解的問(wèn)答基準(zhǔn),主要覆蓋計(jì)算機(jī)科學(xué)論文,支持文本輸入和PDF頁(yè)面圖像輸入兩種形式,可用于評(píng)測(cè)LLM、VLM、文檔理解模型和RAG方法等。
從數(shù)據(jù)規(guī)模看,RPC-Bench最終包含4150篇論文和61.3K個(gè)QA。其中開(kāi)發(fā)集和測(cè)試集經(jīng)過(guò)人工驗(yàn)證,用于更穩(wěn)定地評(píng)估模型表現(xiàn);訓(xùn)練集則作為補(bǔ)充數(shù)據(jù),供研究人員根據(jù)具體實(shí)驗(yàn)?zāi)繕?biāo)選擇使用。
![]()
RPC-Bench的論文主要來(lái)自O(shè)penReview,因此領(lǐng)域分布以AI和計(jì)算機(jī)科學(xué)子領(lǐng)域?yàn)橹鳎∕L Theory、CV、NLP、RL、Optimization、Generative Models等方向。
![]()
相比已有研究論文/文檔問(wèn)答基準(zhǔn),RPC-Bench的特點(diǎn)在于:真實(shí)review-rebuttal來(lái)源、內(nèi)容導(dǎo)向的細(xì)粒度taxonomy、多維度回答質(zhì)量評(píng)估,并同時(shí)支持文本與頁(yè)面圖像輸入。
![]()
RPC-Bench是怎么構(gòu)建的?
![]()
RPC-Bench的構(gòu)建流程包括四個(gè)環(huán)節(jié):
1. 數(shù)據(jù)收集與篩選 :從OpenReview收集2013-2024年的論文、review、rebuttal和元數(shù)據(jù),并結(jié)合AMiner引用信息進(jìn)行質(zhì)量篩選和影響力感知采樣。
2. 拆解審稿互動(dòng) :使用GPT-4o將長(zhǎng)review/rebuttal拆分為更小的comment-response單元,使每個(gè)單元盡量聚焦一個(gè)問(wèn)題或澄清點(diǎn)。
3. 改寫(xiě)為標(biāo)準(zhǔn)QA :使用GLM-4-Plus和DeepSeek-V3將comment-response單元改寫(xiě)為可獨(dú)立理解的問(wèn)題與答案,并分配taxonomy標(biāo)簽。
4. 過(guò)濾與人工復(fù)核 :過(guò)濾編輯性問(wèn)題、外部資源依賴和空泛承諾;開(kāi)發(fā)集和測(cè)試集進(jìn)一步人工復(fù)核,確保問(wèn)題可回答、答案有依據(jù)、分類(lèi)合理。
這種LLM-human collaborative annotation的設(shè)計(jì),一方面利用模型降低大規(guī)模構(gòu)建成本,另一方面通過(guò)人工復(fù)核控制開(kāi)發(fā)集和測(cè)試集質(zhì)量。
論文理解被拆成哪些能力?
RPC-Bench設(shè)計(jì)了一個(gè)對(duì)齊科學(xué)研究流程的細(xì)粒度taxonomy,用于考察模型在學(xué)術(shù)語(yǔ)境中回答what、how、why問(wèn)題的能力:從理解概念與背景,到理解方法和實(shí)驗(yàn)如何運(yùn)作,再到解釋設(shè)計(jì)動(dòng)機(jī)、結(jié)果原因和結(jié)論依據(jù)。
![]()
這套分類(lèi)大致對(duì)應(yīng)科研閱讀中的幾類(lèi)核心能力:
what層面 :模型需要解釋概念、術(shù)語(yǔ)、圖表信息和實(shí)驗(yàn)結(jié)果本身,回答“論文說(shuō)了什么”;
how層面 :模型需要理解方法流程、模塊機(jī)制、實(shí)驗(yàn)設(shè)置和評(píng)測(cè)協(xié)議,回答“論文是如何做的”;
why層面 :模型需要分析設(shè)計(jì)動(dòng)機(jī)、實(shí)驗(yàn)現(xiàn)象、方法差異和結(jié)論邊界,回答“為什么這樣做、為什么得到這樣的結(jié)果”;
claim verification層面 :模型需要判斷具體科學(xué)主張是否能從論文證據(jù)中得到支持。
這樣的設(shè)計(jì)讓RPC-Bench不只評(píng)估摘要或事實(shí)定位能力,而是把“讀懂論文”拆成可觀察、可診斷的多個(gè)能力維度。
怎么評(píng)測(cè):不只看答案像不像
開(kāi)放式論文問(wèn)答中,答案和參考答案“長(zhǎng)得像”不一定代表答得對(duì)。因此,RPC-Bench沒(méi)有只依賴ROUGE、BERTScore等表面相似度指標(biāo),而是采用LLM-as-a-Judge的方式,從三個(gè)維度評(píng)估開(kāi)放式回答:
- Correctness:回答內(nèi)容是否正確、是否忠實(shí)于論文(類(lèi)似precision);
- Completeness:是否覆蓋參考答案中的關(guān)鍵信息(類(lèi)似recall);
- Conciseness:是否簡(jiǎn)潔,是否避免無(wú)關(guān)擴(kuò)展(控制冗余和跑題)。
論文進(jìn)一步用correctness和completeness的調(diào)和均值得到F1-like,再結(jié)合conciseness得到Informativeness。對(duì)于Claim Verification,則使用accuracy進(jìn)行評(píng)價(jià)。
![]()
這套指標(biāo)的出發(fā)點(diǎn)比較直接:科研問(wèn)答既不能答錯(cuò),也不能漏答,還不能用大量無(wú)關(guān)內(nèi)容掩蓋關(guān)鍵信息。
在評(píng)估配置上,論文通過(guò)人工一致性實(shí)驗(yàn)校準(zhǔn)LLM-as-a-Judge設(shè)置,最終采用加入標(biāo)題和摘要、分維度評(píng)估、decimal scoring的配置,并選擇GPT-5與Gemini-3-Pro作為主實(shí)驗(yàn)的評(píng)估模型組合。
![]()
![]()
實(shí)驗(yàn)結(jié)果說(shuō)明了什么?
論文評(píng)測(cè)了28個(gè)模型,包括LLM、Document-Centric Model、VLM和RAG方法:
![]()
![]()
從這些結(jié)果中,可以觀察到:
- 強(qiáng)模型仍有明顯提升空間。GPT-5的F1-like為68.20,但加入簡(jiǎn)潔性約束后的Informativeness為37.46。
- 頁(yè)面圖像輸入并不天然優(yōu)于文本輸入。當(dāng)前VLM在長(zhǎng)篇論文、圖表、公式和跨頁(yè)信息整合上仍然不穩(wěn)定。
- RAG不是自動(dòng)解法。檢索片段不完整,或生成階段不能整合方法與實(shí)驗(yàn)邏輯,都會(huì)導(dǎo)致錯(cuò)誤或遺漏。
- 傳統(tǒng)字符串指標(biāo)信號(hào)有限。答案“看起來(lái)相似”不等于真正正確、完整。
論文還通過(guò)case study總結(jié)了常見(jiàn)失敗模式,包括退化重復(fù)輸出、多模態(tài)證據(jù)利用不足、錯(cuò)誤否認(rèn)論文中已有信息,以及True/False等精確輸出格式不合規(guī)。
![]()
當(dāng)然,RPC-Bench也有清晰邊界。它當(dāng)前主要覆蓋計(jì)算機(jī)科學(xué)領(lǐng)域,數(shù)據(jù)來(lái)自O(shè)penReview,任務(wù)重點(diǎn)是單篇論文理解。跨論文綜述、跨領(lǐng)域遷移、多輪科研討論、真實(shí)代碼復(fù)現(xiàn)和實(shí)驗(yàn)驗(yàn)證等能力,還需要進(jìn)一步的評(píng)測(cè)設(shè)計(jì)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.