学 Agent 开发的路线图:从零到上生产的六阶路径
- 理清学 Agent 开发的六阶路径,知道每个阶段该做什么、学什么
- 建立"以做带学"的学习方法,避免看理论看一堆却迟迟迈不出第一步
- 了解本站三支柱课程和这条路线的对应关系,找到自己当前所在位置
- 能用一张阶段路线表快速定位自己该从哪里进入
想学 Agent 开发,资料一堆却不知从哪下手——这是大多数人进这个领域时的真实处境。
搜一圈下来,有人在讲 LangGraph、有人在讲 AutoGen、有人在讲 Dify 拖拽,还有人直接贴一段几百行的多 Agent 代码说"你看懂了吗"。看完更乱,不知道自己该从哪里进。
这篇文章给你一条走得通的路:六个阶段,每阶说清楚目标、该掌握什么、以及坑在哪里。不是最快的路,但是能让你真正把 Agent 做出来、用起来、搞清楚的路。
为什么要有路线,不能东捡一榔头西捡一榔头
很多人学 Agent 开发的方式是这样的:今天看了篇 RAG 文章,跑了个示例;明天看到多 Agent 框架,又去折腾了半天;后天看到有人说要学向量数据库,又去配了个 Milvus。
结果三个月后回头一看——每样都沾过,但一个完整跑通的 Agent 都没有。
问题不在于学的东西错了,而在于顺序乱了。Agent 开发是有依赖关系的:
- 不理解"思考-行动范式",你看工具调用的代码会一脸茫然;
- 没跑过第一个单 Agent,你去折腾多 Agent 编排只会绕在框架配置里出不来;
- 没搞懂记忆分层,你的 RAG 永远在调参数、不知道为什么效果差。
路线图的价值就在这里:给你一个合理的依赖顺序,让每一步都站在前一步的肩膀上,而不是空中楼阁。
关于 AI Agent 是什么、四要素是哪些,如果你还不清楚,建议先看那篇打好底。
六阶路线:从认知到上生产
第一阶:建认知(先搞懂你在造什么)
目标:在写第一行代码之前,搞清楚 Agent 和普通 Chatbot 的本质区别,理解为什么 Agent 能"自己决定下一步"。
该掌握什么:
- 什么是 Agent:不是"更智能的聊天机器人",而是一个有目标、能调工具、会根据结果决定下一步的执行循环。AI Agent 是什么 里讲了这个本质。
- 四要素:模型(大脑)、工具(手脚)、记忆(笔记本)、评估(复盘)。Agent 四要素详解 逐一拆解了这四块,每块不懂就会在后面的开发里踩坑。
- 思考-行动范式:Agent 的核心循环是"想 → 做 → 看 → 想",不是一问一答。理解这个循环,你看任何 Agent 代码都能快速找到它的骨架在哪里。
- 低代码平台 vs 写代码:Coze/Dify 适合快速验证,写代码 Agent 适合长期维护和真正理解原理。知道自己为什么选写代码这条路,学起来更有动力。
坑在哪里:这一阶最常见的坑是"理论看了一堆,但脑子里的 Agent 还是一个模糊概念"。解法很简单——阶段目标不是背概念,而是能用自己的话向别人解释"Agent 和 Chatbot 的本质区别是什么"。能解释清楚了就可以进下一阶。
第二阶:写第一个能跑的 Agent(SDK 起步)
目标:亲手写出一个能跑的 Agent,不用拖拽,不依赖低代码平台,就是自己的代码,自己的循环。
该掌握什么:
- 装 SDK、配 key:Claude Agent SDK(Python 或 Node.js)装好,API key 配进环境变量,第一次调用能通。
- 最小主循环:
tools 列表 + TOOL_FUNCTIONS 字典 + while 循环就是一个完整 Agent 的骨架,几十行代码。重点是看懂stop_reason: tool_use和stop_reason: end_turn的切换——这就是思考-行动范式在代码里的体现。 - 加一个真工具:别停在"Hello World"级别,给 Agent 加一个真实工具(查文件、调 API、搜数据),让它真正干一件事,不只是回答问题。
- 工具 description 怎么写:模型靠 description 决定要不要调这个工具,写得模糊就是 bug 的来源。"获取时间"是烂的,"获取当前日期和时间,用来回答'现在几点'或'今天几号'一类的问题"是好的。
用 Claude Agent SDK 写出你的第一个能跑的 Agent 这节给了完整可复制代码和故障排查表,30 分钟能跑通。
坑在哪里:这一阶最怕"代码抄过来跑通了,但不知道为什么这么写"。建议每一段都自己敲,不要直接粘贴,敲的时候想"这行是 Agent 的哪个要素"。
第三阶:给它装能力(Skills 与 MCP)
目标:让 Agent 不再只会几个硬编码工具,能按需加载技能、接上外部系统。
该掌握什么:
- Skills:把"怎么做某类事"写成
SKILL.md文件,Agent 按需加载,不占死上下文。适合"让它学会一套操作流程",比如"怎么发周报"、"怎么处理退款申请"。 - MCP(Model Context Protocol):通过标准化协议给 Agent 接上外部系统——文件系统、数据库、第三方 API。不是替代 Skills,而是和 Skills 分层组合:MCP 负责"连得上",Skills 负责"会做事"。
- 工具选择策略:工具多了之后,模型选工具的准确率会下降。要学会用分组、description 优化、动态工具加载来保持准确率。
坑在哪里:这一阶最常见的误区是"拼命加工具,以为工具越多 Agent 越强"。实际上工具太多、描述写得差,Agent 的表现反而变差。工具质量 > 工具数量,这是这一阶最重要的认知。
第四阶:加记忆与知识(三层记忆 / RAG / 文件式记忆)
目标:让 Agent 不再是"一次性"的,能记住用户、记住上下文、能检索知识库。
该掌握什么:
- 三层记忆:上下文窗口内(会话内短期记忆)、外部存储(跨会话持久化)、检索记忆(RAG)。三层各有适用场景,不能混用,混用了既贵又效果差。
- RAG 基础:向量化 → 存库 → 检索 → 注入上下文。核心问题不是"哪个向量数据库好",而是"检索回来的块有多少是有用的"——Recall 和 Precision 两个指标先搞清楚。
- 文件式记忆:把用户偏好、历史摘要存成结构化文件,Agent 每次运行时加载。不是最先进的方案,但实现简单、可解释、适合大多数实际场景。
- 记忆压缩策略:上下文窗口有限,长对话需要摘要压缩历史。怎么摘要、保留什么、丢弃什么,是一门技巧。
坑在哪里:RAG 很容易"能跑但效果差"。最常见原因是分块策略不对(块太大什么都有、块太小语义断了)和检索策略单一(只用向量检索,没有关键词检索兜底)。这一阶建议先用最简单的文件式记忆跑通,再上 RAG。
第五阶:多 Agent 与编排(子代理优先,框架按需)
目标:把单 Agent 扩展到多个 Agent 协作,让复杂任务能被分解、并行、隔离处理。
该掌握什么:
- 为什么需要多 Agent:单 Agent 的上下文窗口是有限的。任务太长、太复杂,要么上下文撑不住,要么 Agent 开始犯糊涂。多 Agent 的核心价值是上下文隔离——子代理在自己的独立会话里干完自己那块,只把结论交回来。
- 子代理模式(Subagent):主 Agent 拆解任务,分发给专门的子代理,汇总结果。关键是怎么设计任务拆解粒度和子代理接口。
- 编排框架:LangGraph、CrewAI 等框架的价值是状态管理和流程控制,而不是"魔法"。先搞懂手写编排是怎么回事,再用框架提速,不要一上来就被框架 API 淹没。
- 并行 vs 串行:知道哪些子任务可以并行(互不依赖)、哪些必须串行(有依赖关系),这直接决定整体耗时。
坑在哪里:这一阶最容易的坑是"过度工程"——一个简单任务强行上多 Agent,结果调试难度翻倍、延迟变高、效果还不如单 Agent。能用单 Agent 搞定的,就别拆多 Agent,拆是为了解决具体瓶颈,不是为了显得"架构高级"。
第六阶:上生产(评估 / 可观测 / 部署 / 场景落地)
目标:让 Agent 从"能跑"变成"可以给真实用户用",加上评估、日志、错误处理、部署。
该掌握什么:
- 评估(Evaluation):Agent 不像传统软件,没有"通过/失败"的明确边界。你需要建评估集——给一批真实任务,跑 Agent,打分,版本间比较。没有评估就是在盲飞。
- 可观测性(Observability):每次 LLM 调用、工具调用、工具结果都要有日志。生产里 Agent 出问题,没有可观测性你根本不知道它在哪步犯糊涂了。
- 错误处理与限流:工具调用会失败,模型调用会超时,
max_rounds计数器要有,重试要有退避策略,不能让 Agent 死循环。 - 部署形式:同步 API(用户等结果)、异步任务(后台跑完通知)、定时触发(每天跑一次报告),三种形式对应不同场景,选错了用户体验很差。
- 场景落地:客服、代码生成、数据分析、流程自动化——不同场景的 Agent 设计重点不一样。这一阶要学会从"我有个 Agent"到"它能解决这个场景的具体问题"。
坑在哪里:这一阶最常见的教训是"本地跑得很好,生产里一堆奇怪问题"。网络抖动、并发冲突、用户输入边界情况——本地测不到,生产才暴露。上线前做好压测、边界 case 覆盖,是这一阶的基本功。
以做带学:一个能跑的 Agent 胜过看十篇理论
路线有了,方法很重要。
Agent 开发这个领域有一个特点:理论密度很低,实操密度很高。读三篇理论文章花的时间,拿来跑通一个最小 Agent,收获是后者的五倍。
以做带学的操作方式:
- 每一阶以"跑通一个具体东西"为结束标志,不是"看完了某章"。第一阶结束标志是能向别人讲清楚 Agent 四要素;第二阶结束标志是有一段自己写的 Agent 代码能跑通。
- 遇到概念先跑代码,跑完再回来理解。比如看到"tool_use"不知道是什么,别先去查文档——先把标杆代码跑一遍,看到终端输出里的
stop_reason: tool_use,概念自然就清楚了。 - 不要等"准备好了"才开始。很多人总觉得"还没看完理论,等我看完再写代码"。这个准备好的时间点永远不会来。带着问题去跑,跑的时候自然会产生问题,问题驱动你真正理解概念。
- 每个阶段做一个小项目,哪怕只是一个能查某个 API 的 Agent、一个能帮你整理文件的 Agent。有具体产出的学习,比刷视频课扎实十倍。
阶段路线表
| 阶段 | 核心任务 | 结束标志 | 参考节点 |
|---|---|---|---|
| L1 建认知 | 理解 Agent 四要素和思考-行动范式 | 能向别人讲清楚 Agent 和 Chatbot 的区别 | AI Agent 是什么、四要素详解 |
| L2 跑第一个 | 用 SDK 写最小可跑 Agent,真调工具 | 终端看到 tool_use → end_turn 输出 |
SDK 写第一个 Agent |
| L3 装能力 | 给 Agent 接上 Skills 和 MCP | 能从外部系统检索数据并回答 | AI 数字员工落地指南 |
| L4 加记忆 | 三层记忆分层,跑通跨会话记忆 | Agent 能记住上次对话的关键信息 | AI 数字员工落地指南 |
| L5 多 Agent | 拆子代理,主 Agent 编排分发 | 两个子代理协作完成一个复合任务 | AI 数字员工落地指南 |
| L6 上生产 | 加评估、日志、错误处理、部署 | Agent 上线,有监控,能排查问题 | AI 数字员工落地指南 |
从哪里进入?找到自己还没完成的最低阶段,从那里开始。如果你完全没跑过 Agent 代码,从 L1 开始;如果第一个 Agent 跑通了但不知道怎么加记忆,从 L4 开始。
本站三支柱课程和这条路线的对应关系
本站的三个学习支柱正是按这条路线组织的:
- AI Agent 智能体:系统覆盖 L1 到 L6 的完整路径,从"什么是 Agent"一直到多 Agent 编排和上生产,是主线课程的所在地。
- AI 编程:支撑你在每个阶段真正能写代码,不只是看懂别人写的,而是自己能写出来。
- AI 组织落地:L6 之后的延伸——Agent 技术落地到真实组织里会遇到什么问题、怎么推进,这条线讲的是"人 + AI"协作的实战经验。
三条线不是孤立的,而是互相支撑:编程基础帮你跑通 L2-L5,Agent 主线给你清晰路径,组织落地帮你把技术变成真实价值。
常见问题
Q:我要先学 Python 到什么程度才能开始学 Agent 开发?
能写函数、会用字典列表、装得上第三方库,就够进 L2 了。你不需要学完一整本 Python 书。Agent 开发里用到的 Python 语法并不复杂,真正的复杂度在"如何设计 Agent 的结构和工具",而不在 Python 本身。遇到不懂的语法,边查边学,比"先把 Python 学完再学 Agent"快得多。
Q:LangChain / LangGraph / CrewAI 这些框架我该从哪个学?
建议先不学任何框架,用裸 SDK 写通 L2,理解了 Agent 的本质循环之后,再看框架。框架是在裸 SDK 基础上加了状态管理、流程控制等封装,没有裸 SDK 的基础,你学框架只是在照着文档抄配置,出了问题完全不知道从哪查。用 Claude Agent SDK 写出你的第一个能跑的 Agent 就是这条路的起点。
Q:从学到第一个真实可用的 Agent,需要多长时间?
L1 + L2 认真做,周末两天足够跑通一个有实际工具的 Agent。"真实可用"要看场景复杂度——一个能查 API、写报告的 Agent,两周认真做下来基本能上线;多 Agent 编排和上生产要更长,取决于你的目标场景。不要把"上生产"作为学的前提,先跑通 L2,你已经有了一个有用的东西。
Q:我之前学过 LangChain,这条路线还适合我吗?
适合,而且会很快。你可能跳过了 L1/L2 的认知建立,直接上了框架——建议补一遍 L1 的四要素和思考-行动范式,再对照你以前写的 LangChain 代码,看看"每一块在代码里是哪里"。这个对照练习能帮你把碎片化的框架经验变成系统认知。
小结
六个阶段,清晰的依赖顺序,以做带学的方法——这是学 Agent 开发最不容易绕弯路的路。
从 AI Agent 是什么 建起认知,到 用 SDK 写第一个能跑的 Agent 迈出第一步,再一阶一阶往上走。每一阶都有具体的结束标志,你不会迷失在"到底学到什么程度才算够"的焦虑里。
路线是给你省时间的,不是让你依赖的。真正的进展来自你敲代码、跑 Agent、看到它跑通的那一刻。
👉 看看 AI 数字员工落地指南,或了解 数字员工搭建实战课。需要为企业落地方案,欢迎找我们聊 企业服务。