多 Agent 与项目
Day 30 - Summary, Retrospective, and Next Steps
今日目标
能输出 30 天学习复盘与下一阶段学习路线。
学习安排
| 时间 | 模块 | 做什么 |
|---|---|---|
| 0-10 分钟 | 回顾核心概念 | 通读 30 天术语清单,圈出 3 个你已经能在工作中用上的概念。 |
| 10-25 分钟 | 回顾交付物 | 逐个核对 30 天的产出,找出缺漏与薄弱环节。 |
| 25-45 分钟 | 复盘报告 | 完成《AI Agent 30 天学习复盘》,总结收获与缺口。 |
| 45-55 分钟 | 追问与查漏 | 回答追问练习,把仍不清楚的概念整理成复习清单。 |
| 55-60 分钟 | 规划下一步 | 写下下一阶段两周计划与第一个落地场景。 |
核心概念
| 术语 | 中文解释 | 应用场景 |
|---|---|---|
| retrospective | 复盘,回顾过程与结果,找出可保持与可改进的点 | 30 天结束时回顾学习路径与交付物 |
| deliverable review | 交付物核查,逐项核对计划产出是否完成、质量如何 | 核对 Day 10、Day 20、Day 30 三批交付物 |
| knowledge gap | 知识缺口,学了但解释不清或不会用的概念 | 把说不清的概念列入复习清单 |
| next roadmap | 下一阶段路线,按优先级排的学习与落地计划 | 定下未来两周做什么、按什么顺序做 |
| landing scenario | 落地场景,工作中第一个值得让 Agent 上线的场景 | 选低风险、高重复、输入输出明确的场景 |
| minimal closed loop | 最小闭环,从用户问题到答案到评估的完整链路 | 用户问题 -> 构造上下文 -> 规划 -> 调用工具 -> 生成答案 -> 评估 |
| human-in-the-loop | 人工确认,涉及生产配置、删除、发消息、合并代码等操作必须有人确认 | 高风险工具调用前暂停等待确认 |
| trajectory debugging | 轨迹调试,靠运行日志定位 Agent 每一步的输入输出与错误 | 失败案例回放,找出是模型还是工具出错 |
| capability inventory | 能力清单,明确自己已经具备与还欠缺的 Agent 工程能力 | 写复盘时盘点上下文、工具、RAG、评估的掌握度 |
| eval-driven | 评估驱动,没有评估集就不判断改动好坏 | 每次改动先跑 eval 再下结论 |
阅读重点
- 对应章节:全计划回顾,覆盖第 1-8 章与第 10 章,重点是串起整条学习主线:能设计上下文、能接工具、能查知识库、能记录轨迹、能用 eval 判断好坏,最后做出一个可解释、可控、可改进的小型 Agent。
- 关注点:
- 最小闭环的七个环节:用户问题、构造上下文、LLM 规划、调用工具、回填结果、生成答案、评估,你哪一环最熟、哪一环最弱。
- 工程落地五原则:先只读后写入、先单 Agent 后多 Agent、先 eval 再优化、先小场景后大平台、保留人工确认。
- 学习顺序优先级:基础执行循环、上下文工程、工具调用、RAG 与知识库、评估、多 Agent、后训练与持续进化。
- 30 天的阶段交付物是否齐全:Day 10 的架构图与上下文设计、Day 20 的 RAG 与工具 Demo、Day 30 的综合 MVP 与评估结果。
- 补充材料:
- 自己 30 天的日志与复盘记录,作为复盘的原始素材。
- 目标框架的官方文档(如 LangGraph、OpenAI Agents SDK),作为下一阶段的入口。
理解检查
- 现在你如何定义 AI Agent?和 30 天前的定义有什么不同?
- 你认为 Agent 工程里最重要的 3 个能力是什么?依据是什么?
- 你的 Demo 离生产可用还差什么?列出具体的差距。
- 你下一步应该深入 RAG、工具、多 Agent、评估还是 Coding Agent?
实践任务
背景:今天是最后一天,把 30 天的学习整理成一份可分享、可复查的复盘报告,并为下一阶段定方向。
- 第 1 步:用下面的输出模板写《AI Agent 30 天学习复盘》。
- 第 2 步:逐项核对三批阶段交付物:Day 10 的架构图、上下文设计、结构化 Prompt、Skill 草稿;Day 20 的最小 RAG Demo、工具 schema、工具调用 Demo、权限与风险清单;Day 30 的综合 MVP、20 条 eval set、运行结果复盘、学习路线。
- 第 3 步:写出 3 个仍不清楚的概念,每个注明卡在哪一点。
- 第 4 步:写下下一阶段两周计划,包含 1 个可验证目标和 1 个工作中可落地的低风险场景。
输出模板
《AI Agent 30 天学习复盘》
一、学到了什么
- 核心能力盘点:[能设计上下文 / 能接工具 / 能查知识库 / 能记录轨迹 / 能用 eval 判断好坏]
- 交付物核对:[Day 10 / Day 20 / Day 30 三批交付物是否齐全,缺什么]
二、做出了什么 Demo
- Demo 名称:[...]
- 输入与输出:[...]
- 评估结果:[成功 [n] 条 / 失败 [n] 条,失败原因归类]
三、哪些概念仍不清楚
- [概念] -> [卡在哪一点]
四、哪些工程能力需要补
- [能力] -> [具体欠缺与补法]
五、下一阶段计划
- 方向:[RAG / 工具 / 多 Agent / 评估 / Coding Agent,选一个]
- 两周目标:[1 个可验证目标]
- 落地场景:[低风险、高重复、输入输出明确的场景]
- 保留的边界:[哪些操作必须人工确认]
示范输出
《AI Agent 30 天学习复盘》
一、学到了什么
- 核心能力盘点:能设计上下文与 system prompt;能设计工具 schema 并处理失败;能搭最小 RAG 链路;能记录运行轨迹;能用 20 条 eval set 判断改动好坏
- 交付物核对:Day 10 齐全;Day 20 缺权限与风险清单;Day 30 的 eval set 只有 12 条,需要补齐
二、做出了什么 Demo
- Demo 名称:技术问题分析 Agent(Nginx WAF CPU 排查)
- 输入与输出:输入「开启 WAF 后 Nginx CPU 升高」,输出带证据标注的 Markdown 分析报告
- 评估结果:成功 7 条、失败 3 条,失败集中在工具返回空数据时未标注缺口
三、哪些概念仍不清楚
- 上下文压缩 -> 不清楚分层摘要何时触发
- 模型后训练 -> 说不清 SFT 与 RL 各自适合什么情况
- 共享记忆 -> 只会说风险,不会设计隔离方案
四、哪些工程能力需要补
- 评估设计 -> 用例覆盖失败场景不够,编造率指标未量化
- 轨迹调试 -> 失败时靠肉眼翻日志,不会系统回放
五、下一阶段计划
- 方向:评估与 RAG 检索质量
- 两周目标:把 eval set 补到 20 条,编造率降到 0
- 落地场景:测试日报生成 Agent,只读数据源、输出 Markdown、不碰生产配置
- 保留的边界:发送邮件、修改配置、删除数据一律人工确认
追问练习
- 你的 Demo 离生产可用还差什么?逐项列出差距与补法。
- 你下一步应该深入哪个方向?判断依据是什么,而不是「感觉有意思」。
- 如果要在工作中落地一个 Agent,你会从哪个低风险场景开始?为什么是它?
- 用一句话定义 AI Agent,你现在的版本是什么?
常见误区
- 复盘只写收获、不写知识缺口,报告变成自我表扬。
- 下一阶段计划定得太大,没有两周内可验证的目标。
- 认为 30 天就能掌握所有 Agent 框架,反而一个都不扎实。
- 落地场景选高风险操作,比如一上来就做自动改配置的 Agent。
进阶扩展
- 学习顺序优先级:时间不够时按「基础执行循环、上下文工程、工具调用、RAG 与知识库、评估、多 Agent、后训练与持续进化」的顺序补课,先跑通最小闭环,不要一开始陷入复杂框架。
- 工程落地五原则:先只读后写入,先单 Agent 后多 Agent,先 eval 再优化,先小场景后大平台,涉及生产配置、数据库删除、发邮件、发消息、合并代码等操作必须保留人工确认。
- 学习方法:每天产出一个可复用的小产物,每 5 天复盘一次记录「能解释什么、能做出什么」,每个 Demo 保留日志,因为 Agent 调试主要靠轨迹。
今日作业
- 完成《AI Agent 30 天学习复盘》,五个部分都要写。
- 写下下一阶段两周计划,包含 1 个可验证目标和 1 个落地场景。
- 整理 30 天交付物目录清单,标出缺失项。
- 挑出 3 个仍不清楚的概念,写进复习清单。