![]()
導語
集智俱樂部、集智學園創始人,北京師范大學張江教授開設了,致力于打破學科壁壘,將復雜系統與人工智能深度融合。從神經網絡到因果推斷,從世界模型到多尺度建模,甚至包含最前沿的“氛圍編程(Vibe Coding)”實戰,帶你親手落地AI項目。
作為系列課程的第十四講,張江教授將以「自我演化的人工智能」為題,圍繞遞歸自改進理論、大模型推理增強、自對齊與自精煉、強化學習、演化提示優化及自主智能體框架展開講解,剖析自進化 AI 技術脈絡、落地路徑與復雜系統應用邊界。正式分享將于6月29日(周一)13:30-16:15騰訊會議線上直播。
課程簡介
大語言模型推理短板、人工標注成本高、模型迭代依賴外部監督是復雜系統 AI 落地核心瓶頸,遞歸自改進、自主進化范式為破局關鍵。本課程依托系統科學視角,梳理自進化 LLM 完整技術脈絡,融合思維鏈、自一致性、樹搜索推理、自反饋精煉、強化學習對齊、演化計算提示優化、自主智能體框架六大技術主線。推理線講解 CoT、Self-Consistency、ToT、TS-LLM 等深度思考機制,解決數學、社科復雜多步推理;自改進線拆解 Self-Improve、Self-Refine、Self-Align 無標注迭代方案;強化學習線覆蓋 PPO、GRPO、Reflexion 反思智能體;演化計算線講解遺傳算法、EVOPROMPT、PromptBreeder 自動提示進化;最后落地多智能體自進化系統、遞歸自改進理論與技術奇點邊界。課程結合 Math-Shepherd、AlphaZero、達爾文哥德爾機等經典案例,覆蓋社科建模、管理仿真、科學計算等復雜場景。
學完可完整掌握大模型自主迭代全鏈路,能搭建自進化推理智能體,將遞歸自改進方法應用于社會科學、管理決策、復雜系統仿真研究。
課程大綱
一、基礎背景:技術奇點與遞歸自改進理論
馮?諾依曼技術奇點定義、Yampolskiy 遞歸自改進(RSI)理論層級
AI 智能體演化全景:單智能優化、多智能協同、領域專用智能體分支
大模型訓練基礎:預訓練、微調、上下文學習三層范式
自進化核心四階段:經驗獲取、經驗精煉、模型更新、效果評估
二、LLM 深度推理增強:從單鏈到樹狀搜索
基礎推理:思維鏈 CoT、自一致性 Self-Consistency 投票機制
分步過程獎勵:Math-Shepherd 無人工分步標注推理打分框架
樹搜索推理:思維樹 ToT、類 AlphaZero 蒙特卡洛 TS-LLM 深度推理
對比實驗:24 點、GSM8K、高等數學、社科邏輯任務效果驗證
三、無監督大模型自改進(Self-Improved LLM)
LMSI 自訓練:模型生成高置信推理樣本反向微調
Self-Refine 自反饋迭代:生成-自評-修正閉環,零訓練輕量化優化
Self-Align 指令自對齊:少量種子數據 + 網頁文本自動擴充指令集
自對齊實驗:LLaMA 系列開源模型指令調優性能對比
四、大語言模型 + 強化學習(LLM+RL)
傳統 PPO 與分組獎勵 GRPO 優化框架
Reflexion 反思智能體:短時軌跡記憶 + 長期反思文本復盤試錯
AlphaZero 范式:價值網絡、策略網絡、蒙特卡洛樹搜索
落地場景:多步驟文本任務、代碼生成、多輪決策推理
五、LLM + 演化計算:提示詞自主進化
遺傳算法基礎:種群、適應度、交叉、變異、選擇機制
EVOPROMPT:差分進化/遺傳算法自動優化提示模板
PromptBreeder 雙層自進化:任務提示 + 變異提示同步迭代
應用:文本分類、摘要、復雜邏輯任務提示自動生成
六、自進化 AI 智能體系統(Self-evolved AI Agent)
單智能體自進化四大范式:離線預訓練、在線適配、反思迭代
多智能體編排 MAO 與多智能自進化 MASE 架構
先進框架:MetaGPT、達爾文哥德爾機 DGM、G?del Machine
自進化三定律:安全穩定、性能保優、自主自適應優化
七、自進化 AI 局限與復雜系統落地邊界
模型坍塌、算力約束、高質量數據枯竭問題
遞歸自改進計算理論上限、智能爆炸臨界閾值討論
社科/管理學落地:問卷模擬、元分析編碼、決策智能體工作流
未來方向:開放進化多智能體、跨領域通用自進化系統
關鍵詞
遞歸自改進(RSI):分層遞進的 AI 自我升級體系,分為自修改、自優化、遞歸持續進化三層,是技術奇點核心理論基礎。
自一致性(Self-Consistency):大模型生成多條推理路徑,通過投票篩選最高頻答案,低成本提升復雜推理精度。
Math-Shepherd:全自動分步過程獎勵模型,無需人工標注即可對數學推理每一步打分,支撐分步強化學習。
思維樹(Tree of Thoughts, ToT):將推理拆解為多分支樹形結構,支持自主評估、回溯搜索,突破線性 CoT 推理局限。
TS-LLM:借鑒 AlphaZero 蒙特卡洛樹搜索的大模型推理框架,獨立訓練價值網絡實現超深度思考。
Self-Refine:零訓練自反饋迭代機制,同一模型完成生成、缺陷自評、內容修正三步循環優化輸出。
Self-Align:指令自對齊方案,依托少量人工種子數據,自動擴充、篩選高質量指令微調樣本。
Reflexion:帶長短記憶的反思智能體,記錄試錯軌跡生成反思文本,借助語言反饋完成強化學習。
GRPO:分組近端策略優化,一次性采樣多條模型輸出統一計算獎勵,相比 PPO 提升訓練效率。
EVOPROMPT:融合遺傳 / 差分演化算法的自動提示優化工具,通過交叉變異迭代生成最優任務提示。
PromptBreeder:雙層自進化提示框架,同步優化任務提示與提示變異規則,實現無人工干預提示迭代。
達爾文哥德爾機(DGM):可自主修改自身代碼的開放進化智能體,通過版本存檔與性能篩選持續迭代。
多智能體自進化(MASE):多智能體協同與環境交互,自主優化提示、工具、記憶、協作流程。
模型坍塌(Model Collapse):模型使用 AI 生成數據迭代訓練后,輸出多樣性持續衰減、表達趨于無意義的退化現象。
技術奇點(Technological Singularity):馮?諾依曼提出的臨界閾值,AI 實現無上限遞歸自我進化,徹底變革人類生產研究范式。
課程信息
課程主題:自我演化的人工智能
課程時間:2026年6月29日(周一) 13:30-16:15
課程形式:騰訊會議(會議信息見群內通知),集智學園網站錄播(3個工作日內上線)
課程主講人
張江,北京師范大學系統科學學院教授,集智俱樂部、集智學園創始人,集智科學研究中心理事長,曾任騰訊研究院、華為戰略研究院等特聘顧問。主要研究領域包括因果涌現、復雜系統分析與建模、規模理論等。
個人主頁:https://jake.swarma.org/
課程適用對象
理工科背景高年級本科生
理工科背景碩士、博士研究生
報名須知
1. 課程形式:
參與方式:付費學員可參與騰訊會議直播/北師大海淀區線下授課(助教可協助入校)
授課形式:
平時:課堂討論與內容共創
結課:項目匯報
2. 課程周期:2026年3月2日-2026年6月22日,每周一 13:30-16:15進行。
3. 課程定價:399元
課程鏈接:https://campus.swarma.org/v3/course/5684?from=wechat
付費流程:
課程頁面添加學員登記表,添加助教微信入群;
課程可開發票。
課程共創任務:課程字幕
為鼓勵學員深度參與、積極探索,我們致力于形成系列化知識傳播成果,并構建課程知識共建社群。為此,我們特別設立激勵機制,讓您的學習之旅滿載收獲與成就感。
課程以老師講授為主,每期結束后,助教會于課程群內發布字幕共創任務。學員通過參與這些任務,不僅能加深對內容的理解,還可獲得積分獎勵。積分可兌換其他讀書會課程或實物獎品,助力您的持續成長。
推薦課程
參考課程
吳恩達:Build with Andrew https://www.deeplearning.ai/courses/build-with-andrew/
Jure Leskovec: Machine Learning with Graphs, StanfordCS224W.https://www.youtube.com/playlist?list=PLoROMvodv4rPLKxIpqhjhPgdQy7imNkDn
Steve Brunton: Data Driven Science and Engineering, University of Washingtonhttps://www.youtube.com/playlist?list=PLMrJAkhIeNNRpsRhXTMt8uJdIGz9-X_1-
Karthik Duraisamy: DATA-DRIVEN ANALYSIS AND MODELING OF COMPLEX SYSTEMS, Michigen institute for computational discovery and engineering, Michigen University.https://micde.umich.edu/academic-programs-old/data-driven-course/
Sergey Levine: Deep Reinforcement Learning, CS 285 at UC Berkeley.http://rail.eecs.berkeley.edu/deeprlcourse/
【集智學園網站資源】
對復雜系統連續變化自動建模——Neural Ordinary Differential Equations解讀https://campus.swarma.org/course/2046
復雜網絡自動建模在大氣污染中的應用https://campus.swarma.org/course/1998
兩套因果框架深度剖析:潛在結果模型與結構因果模型https://campus.swarma.org/course/2526
穩定學習:發掘因果推理和機器學習的共同基礎https://campus.swarma.org/course/2323
因果強化學習https://campus.swarma.org/course/2156
張江:因果與機器學習能夠破解涌現之謎嗎https://campus.swarma.org/course/4540
因果涌現理論提出者:Erik Hoel主題報告https://campus.swarma.org/course/4317
如何從數據中發現因果涌現——神經信息壓縮器https://campus.swarma.org/course/4874
標準化流技術簡介https://campus.swarma.org/course/1999
帶隱狀態的強化學習世界模型https://campus.swarma.org/course/4848
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.