![]()
導語
面向大模型驅動科研自動化的發展趨勢,探討生成式人工智能在科研流程中的能力邊界與方法價值。本期讀書會為Vibe Modeling讀書會第九期,中山大學物理與天文學院CIBR吉妮實驗室實習生賈梓杏將聚焦于經典科研智能體論文,分析大模型在科研自動化中的應用路徑與評價方法,并探討如何在 Vibe Modeling 實踐中提升模型結果的可靠性,以及人類研究者在智能化科研中的作用。
集智俱樂部聯合同濟大學長聘副教授陳小楊和北京林業大學副教授李周園共同發起,本讀書會旨在跨越硬科技與社會科學兩大板塊,系統梳理Vibe Modeling的技術現狀、應用潛力與開放問題,通過集體實踐形成可復用的提示策略及評估方法,為這一新范式奠定早期社區基礎,助力推動其在各領域的規范化應用與人才培養落地。
報告簡介
本期將以介紹多篇頂會/頂刊論文的Journal Club形式,從前 8 期聚焦的具體建模應用轉向方法論層面的系統反思。圍繞大模型驅動科研自動化的可信性與能力邊界,講解從領域專用輔助建模到端到端全自動科研的演進路徑,結合認知建模(GeCCo)與全流程自動化(The AI Scientist)等典型案例,介紹相關技術實現的 Pipeline、迭代優化機制與多維度評估體系。進而深入探討 LLM 科研能力邊界的實證研究,以及如何在具體任務評估模型的結果,如神經元激活視角(SAE)與領域專用 Benchmark(LLM-SRBench、SIMBENCH),并能從一些學界提供的方法中學會如何在我們Vibe Modeling的過程中如何評估并優化模型給我們的答案。最終基于 Human or AI in the Loop 的理論辨析與 生成模型對于人類Critical Thinking 實證研究,重新審視自動化時代人類研究者的核心價值、批判性角色。
分享大綱
大模型輔助科研的 Pipeline:從領域專用建模到端到端自動化
生成結果的評估:多維度能力邊界與可信及可行性檢驗
人類的作用:自動化浪潮中的批判性角色再定位
核心概念
端到端自動化科研(End-to-End Automated Research)
以 The AI Scientist 為代表的系統,旨在將科研全流程——從 Idea 生成、文獻檢索、實驗規劃、代碼實現、結果可視化、論文撰寫到同行評審——交由智能體自主完成。
逆向工程(Reverse Engineering)
在評估 LLM 科研能力時,反向工程指模型從黑盒系統的輸入-輸出對中推斷其內部機制(如程序、形式語言或數學方程)的過程。Princeton 的研究將其形式化為:給定觀測集合 O={(xi,yi)} ,模型需輸出對黑盒函數 f? 的假設。這是檢驗 LLM 是否具備「科學發現」能力的基礎任務。
自動化評審(Automated Review)
The AI Scientist 中用于評估生成論文質量的子系統。它模擬頂級機器學習會議(如 NeurIPS)的評審流程,對論文的 Soundness、Presentation、Contribution 進行 1–10 評分,并輸出優缺點與接收/拒絕建議。
人在回路(Human-in-the-Loop, HIL)與 AI 在回路(AI-in-the-Loop, AI2L)
兩種人機協作范式的根本分野。HIL 系統中,AI 掌握決策主導權,人類作為「標注者」或「糾錯者」提供反饋以優化模型;AI2L 系統則相反,人類掌握最終決策權與系統控制權,AI 僅作為輔助工具提供信息、建議或自動化子任務。在科研自動化語境下,Vibe Modeling 更接近 AI2L,而全自動論文生成則偏向 HIL,厘清這一區分對評估責任歸屬與系統設計至關重要。
批判性思維(Critical Thinking)
在生成式 AI 輔助的知識工作中,批判性思維不再僅指傳統的問題解決,而是被重新操作化為:目標與查詢構建(Goal & Query Formation)、響應檢查(Inspect Response)與響應整合(Integrate Response)。知識工作者通過驗證 AI 輸出是否符合客觀標準、交叉核對信息來源、調整風格與語境,來確保最終工作質量。
主講人介紹
主講人:賈梓杏,中山大學物理與天文學院CIBR吉妮實驗室實習生,目前已直博至北京大學前沿交叉學科研究院生命科學聯合中心。研究領域:類腦結構計算建模 、類腦啟發人工智能。
參考文獻
[1] Lu, C., Lu, C., Lange, R. T., Yamada, Y., Hu, S., Foerster, J., Ha, D., and Clune, J. The AI Scientist: Towards end-to-end automation of AI research. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10265-5.
[2] Gottweis, J., Weng, W.-H., Daryin, A., Tu, T., Sirkovic, P., Myaskovsky, A., Glowaty, G., Weissenberger, F., Orlandi, A., Popovici, D., Palepu, A., Rong, K., Tanno, R., Saab, K., Zhang, F., Blum, J., Carroll, A., Kulkarni, K., Toma?ev, N., Zverinski, D., Rendulic, I., Vedadi, E., Hasler, F., Rimanic, L., Boia, M., Budiselic, I., Feinstein, B., Bellaiche, M., Sheffer, T., Freyberg, J., Ratcliff, J., Bertolli, O., Chou, K., Hassidim, A., Gokturk, B., Vahdat, A., Guan, Y., Dhillon, V., Vaishnav, E. D., Lee, B., Costa, T. R. D., Penadés, J. R., Peltz, G., Matias, Y., Manyika, J., Hassabis, D., Xu, Y., Kohli, P., Pawlosky, A., Karthikesalingam, A., and Natarajan, V. Accelerating scientific discovery with Co-Scientist. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10644-y.
[3] Rmus, M., Jagadish, A. K., Mathony, M., Ludwig, T., and Schulz, E. Generating computational cognitive models using large language models. In Advances in Neural Information Processing Systems (NeurIPS), 2025. URL https://arxiv.org/abs/2502.00879.
[4] Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., and Wilson, N. The impact of generative AI on critical thinking: Self-reported reductions in cognitive effort and confidence effects from a survey of knowledge workers. In CHI Conference on Human Factors in Computing Systems (CHI '25), 2025. URL https://doi.org/10.1145/3706598.3713778.
[5] Si, C., Yang, D., and Hashimoto, T. Can LLMs generate novel research ideas? A large-scale human study with 100+ NLP researchers. In International Conference on Learning Representations (ICLR), 2025. URL https://openreview.net/forum?id=M23dTGWCZy.
[6] Ghareeb, A. E., Chang, B., Mitchener, L., Yiu, A., Szostkiewicz, C. J., Shved, D., Gyimesi, G. J., Laurent, J. M., Wright, S. M., Razzak, M. T., White, A. D., Finnemann, S. C., Hinks, M. M., and Rodriques, S. G. A multi-agent system for automating scientific discovery. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10652-y.
[7] Geng, J., Chen, H., Arumugam, D., and Griffiths, T. L. Are large language models reliable AI scientists? Assessing reverse-engineering of black-box systems. arXiv preprint arXiv:2505.17968, 2025. URL https://arxiv.org/abs/2505.17968.
時間信息
2026年7月19日(周日)下午14:00-16:00,騰訊會議線上進行,感興趣的朋友掃碼報名加入Vibe Modeling讀書會后,可進入學員群進行交流。
報名讀書會:「Vibe Modeling」
集智俱樂部聯合同濟大學長聘副教授陳小楊和北京林業大學副教授李周園共同發起,將在集體實踐中探索 Vibe Modeling 在不同領域的通用模式與特殊需求,沉淀可復用的提示策略、評估方法與工作流,為這一范式搭建早期社區基礎,助力 AI 賦能的跨學科研究與人才培養落地。
讀書會自2026年5月17日起,每周日下午14:00-16:00線上開展,持續10周,包含主講分享與討論交流,并提供會后視頻回放,誠邀相關領域研究者及跨學科興趣者參與。
掃描海報中二維碼報名參加讀書會
![]()
報名方式:
第一步:微信掃碼填寫報名信息。
第二步:填寫信息后,付費報名。如需用支付寶支付,請在PC端進入讀書會頁面報名支付:
第三步:添加運營助理微信,拉入對應主題的讀書會社區(微信群)。
PS:為確保專業性和討論的聚焦,本讀書會謝絕脫離 Vibe Modeling 讀書會主題及相關問題的交流討論;如果出現討論內容不符合要求、經提醒無效者,會被移除群聊并對未參與部分退費。
加入社區后可獲得的資源
完整權限包括:線上問答、錄播回看、資料共享、社群交流、信息同步、共創任務獲取積分等。
![]()
特色退費與激勵機制
我們提供以下兩種途徑,讓您的投入獲得實際回饋:
任務達標退費路徑
認領并合格完成任意兩期字幕任務,即可退還全額報名費,并額外獲得集智專屬周邊獎勵。
運營成長激勵路徑
合格完成一個字幕任務后,可申請成為運營助理。在讀書會項目順利結項后,將退還學費。表現優異者,還有機會獲得額外的獎學金。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.