推荐一本硬核的书,它在 GitHub 上开源了,名字叫《深入理解 AI Agent:设计原理与工程实践》,作者是李博杰。
现在讲 Agent 的资料很多,但大多要么停留在“调 API + 写 Prompt”的层面,要么就是纯论文堆砌。本书的价值在于,它用一套可验证、可复现、可动手的方式,把“Agent 到底怎么造出来”讲明白了。
全书围绕一个核心公式展开:Agent = LLM + 上下文 + 工具。难点是如何让这三块协同工作。
作者用 10 章正文 + 88 个配套项目(其中 70 多个可独立运行)来层层拆解:
1. 打地基(第1章):不急着写代码,先让你理解“模型即 Agent”这个新范式,以及先验知识为什么比算法更关键。
2. 喂饱上下文(第2-3章):这是 Agent 的“操作系统”。从 KV Cache 优化、上下文压缩,到用户记忆、混合检索、Agentic RAG,甚至包括 Contextual Retrieval 这种把检索失败率砍掉一半的技术,也都有对应实验。
3. 教会用工具(第4-5章):从感知、执行到协作,构建完整的 MCP 工具链。第5章直接手搓一个生产级 Coding Agent,17 个工具纯 Python 实现,连 Grep 都自己写。
4. 度量与放大(第6-7章):怎么知道 Agent 变强了?Terminal-Bench、SWE-bench、GAIA 这些基准全安排上。第7章直接带用户做模型后训练——SFT、RL、RLHF,连 DeepSeek-R1 蒸馏版都用 DAPO 算法训了一遍。
5. 自我进化(第8章):Agent 不改权重,只靠“经验学习 + 工作流外化 + 提示蒸馏”就能越来越熟练。比如让浏览器自动化操作“固化”成工具,下次直接调用,速度提升 3-5 倍。
6. 走向真实世界(第9-10章):从语音交互、GUI 自动化到多 Agent 协作(狼人杀游戏演示信息不对称)、电话+电脑双 Agent 并行……把 Agent 从“聊天框”里彻底解放出来。
配套做得也很良心:
- 多语言支持:中文、英文、泰米尔语、越南语……
- 电子书格式齐全:PDF、EPUB 都有,也可以自己用 Pandoc + LaTeX 编译;
- 上手门槛低:附了 API Key 申请指南和 20 个外部仓库的一键克隆脚本;
- 协议友好:全书 Apache-2.0 开源,欢迎 PR 贡献勘误和新实验。
🔗 github点com/bojieli/ai-agent-book