![]()
如今,AI 工程師正被迫向“全棧”方向發展。
過去幾年,AI 工程的學習路徑是清晰的:你可能只需要懂模型調用、Prompt、RAG 或一個 Agent 框架,就能搭建出一個看起來不錯的 AI 應用。但到了 2026 年,核心問題已悄然改變:
AI 如何在復雜任務中穩定、可靠、可評估地運行?
這也意味著,問題已不再只涉及單一模塊。模型、訓練、推理、系統與 Agent 編排的邊界變得越來越模糊:
訓練問題,可能同時涉及優化器、數據分布與并行策略;
推理延遲問題,可能來自 Attention 機制、KV cache 或系統調度;
Agent 的失敗,也可能由模型能力、工具接口與記憶機制共同導致。
雖然 AI 技術棧正快速擴展,目前的相關知識卻高度分散,實踐者仍然缺少一張能把模型、訓練、系統與 Agent 串起來的全景地圖。
針對這個問題,亞馬遜首席應用科學家 Haggai Roitman 撰寫了面向實踐者的統一參考手冊。它不只是一篇傳統意義上的論文綜述,而是一張貫穿 Agentic AI 技術棧的導航圖。
![]()
鏈接:https://arxiv.org/abs/2606.24937
對工程實踐者而言,這本書能讓他們面對真實問題時,能夠快速定位自己所處的系統層級,并理解上下游之間的依賴與影響關系。
這本書適合誰看?
這本手冊面向的不只是大眾AI愛好者,還包括構建 AI 系統的工程師、研究員和技術負責人。
Roitman 假設讀者熟悉神經網絡和基礎概率論,但不要求已經具備 LLM、強化學習或系統工程背景。
如果你是ML 工程師,它能幫你理解 Transformer 內部機制、訓練基礎設施、優化方法等;
如果你是應用研究人員,它能幫你比較模型架構、微調策略和面向具體任務的強化學習方法;
如果你是Agent 開發者,它系統梳理了編排模式、記憶架構、工具集成 MCP、多 Agent 協調 A2A,以及生產系統里的評估問題;
如果你是系統工程師,它覆蓋 GPU 集群、分布式訓練、推理部署和 vLLM 等基礎設施問題;
如果你是技術負責人,它更像是一份用于判斷架構取舍和資源投入的全棧參考圖。
讀完后,你將:
1.理解LLM 內部機制,包括注意力機制、位置編碼、MoE 路由和 Flash Attention。
2.理解GPU 系統、分布式訓練、推理優化和基于 vLLM 的生產部署。
3.掌握 LoRA/QLoRA、量化、知識蒸餾、優化器選擇和學習率調度等高效訓練與微調方法。
4.理解 RLHF、DPO、GRPO、KTO 等偏好優化流程,以及獎勵黑客和模式崩塌等常見問題。
5.理解 DeepSeek-R1、OpenAI o1/o3 和 QwQ 等推理模型如何通過強化學習獲得推理能力。
6.學習 Agent 編排、記憶設計、MCP 工具集成、A2A多 Agent 協調和Agent 評估方法。
這本書講了什么
全書的敘述主線很清晰。它不是簡單羅列 AI 術語,而是沿著一條完整路徑展開:一個語言模型如何從底層架構出發,經過訓練、對齊、推理和評估,最終變成能夠行動的 Agent 系統。
第一部分:模型、系統與強化學習的基礎
這一部分從 Transformer、token、注意力機制和優化方法出發,討論序列建模能力的來源,以及 Flash Attention、LoRA、MoE、量化與蒸餾等效率和結構優化方法;同時也覆蓋 GPU 架構、分布式訓練、vLLM 等系統基礎,以及 MDP、TD Learning、Q-Learning、Policy Gradient、Actor-Critic、GAE 等經典強化學習內容,為后續的對齊、推理與 Agent 訓練建立底層框架。
第二部分:LLM 的對齊與強化學習方法
這一部分關注語言模型如何被對齊、優化與訓練,內容覆蓋 RLHF 基礎、PPO、DPO、GRPO 及多種偏好優化變體,也包括獎勵模型訓練、SFT 最佳實踐、大規模訓練系統架構,以及面向 Agent 的軌跡級訓練方法。
第三部分:如何讓模型獲得更強的推理能力?
這一部分聚焦推理能力的形成機制,以 DeepSeek-R1、OpenAI o1/o3/o4-mini 和 QwQ 等模型為例,討論強化學習、過程獎勵、搜索方法與測試時計算如何塑造思維鏈、回溯與自我驗證等推理行為。
第四部分:如何判斷一個模型或 Agent 真的變強了?
這一部分系統討論模型與 Agent 的評估方法,從 perplexity、pass@k、ELO 等指標,到 LLM-as-Judge、人工標注、數據污染檢測,再到面向 Agent 的評估體系,核心在于建立對模型質量與 Agent 能力的可靠衡量方式。
第五部分:如何把訓練好的模型變成能夠行動的 Agent 系統?
這一部分關注 Agentic AI 的工程層,覆蓋 RAG、記憶系統、上下文管理與編排、設計模式、環境與基準、MCP、Agent Skills、A2A、多 Agent 系統、開發框架以及 Agentic UI。
第六部分:如何把這些知識變成可查、可測、可復用的參考體系?
這部分是全書的評估與參考部分,包括覆蓋全書主題的詳細問答題庫、公式與 API 速查表、常見故障與修復線索,以及結尾對未來方向和延伸閱讀的整理。
關于作者
作者 Haggai Roitman 在 AI 研究與大規模生產系統交叉領域深耕二十余年,他的研究興趣涵蓋信息檢索、推薦系統、自然語言處理、LLM、面向 LLM 的強化學習及 Agent 系統。他已發表逾百篇同行評審論文,持有約 100 項專利,本科和博士均畢業于以色列理工學院。
他與 Agent 的故事始于二十年前。攻讀信息系統工程本科期間,Roitman 學習了面向智能體的軟件工程 AOSE,并使用 JADE 構建多 Agent 系統。此后,他又使用 OntoBuilder 構建購物 Agent,嘗試讓系統自動在不同網站上填寫商品搜索和訂單,并通過本體匹配理解不同網站的數據結構。
Haggai Roitman 提到,2024 至 2026 年之所以非同尋常,在于將以下的技術路線匯合到了一起:LLM 提供語言理解與生成能力,強化學習負責推理與對齊,MCP 負責標準化工具調用,編排框架則負責將這些能力組織為可運行的系統。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.