从单智能体到生产级系统:18 课开源 AI Agent 课程工程化路径
【免费下载链接】ai-agents-for-beginners18 Lessons to Get Started Building AI Agents项目地址: https://gitcode.com/GitHub_Trending/ai/ai-agents-for-beginners
刚接触 AI 智能体(AI Agent)的开发者,卡点通常不在写出第一个 agent,而在让它可控、可观测、能部署。开源项目 AI Agents for Beginners 把这条路径拆成 18 门可执行课程,每门都配可直接运行的 Python 示例,基于 Microsoft Agent Framework 与 Foundry Agent Service 完成全部演示。
速览课程骨架:四大核心能力
| 模块 | 解决什么问题 | 关键产出 |
|---|---|---|
| Agentic RAG(05-agentic-rag) | 单次检索无法保证答案正确 | 迭代检索与自校验机制 |
| 多智能体协作(08-multi-agent) | 单 agent 装不下复杂多角色任务 | 交接与群聊两种编排模式 |
| 人机协同(06-building-trustworthy-agents) | 高风险操作不能无人值守 | 人工审批门与权限边界 |
| 可观测与评估(10-ai-agents-production) | agent 行为是黑盒 | Trace 指标与成本控制流程 |
四类能力覆盖了从构建到运营的主线,其余课程(工具调用、规划、上下文工程、记忆、协议)都围绕它们展开。
十分钟跑通第一个智能体
最短路径是克隆、建环境、装依赖,然后直接打开第一课的 notebook:
git clone https://gitcode.com/GitHub_Trending/ai/ai-agents-for-beginners cd ai-agents-for-beginners python -m venv venv && source venv/bin/activate pip install -r requirements.txt第一个可运行示例在01-intro-to-ai-agents/code_samples/01-python-agent-framework.ipynb,按单元格顺序执行即可看到 agent 的完整响应链路。三个容易踩的坑:
- 必须用 Python 3.12+ 创建 venv,低版本会在安装依赖时出现版本冲突;
- 示例连接 Microsoft Foundry Agent Service,需要准备 Azure 账号并在 Foundry 项目中部署一个模型(如 gpt-5-mini);
requirements.txt将agent-framework-core锁在 1.10.x,1.11 引入了破坏性 API 变更,随意升级会导致 notebook 报错。
让检索结果可自校验:Agentic RAG 的迭代循环
普通 RAG 的弱点是检索只发生一次,检索质量差时没有任何纠错机制,错误直接传导到答案。Agentic RAG 把"要不要再查、换哪个数据源查"的决定权交给模型本身。
- agent 自主规划检索动作:重写查询、在向量检索与 SQL、API 之间切换数据源;
- 每轮检索后评估结果质量,不达标就回到检索端重来,形成"检索 → 评估 → 修正"的循环;
- 跨步骤保留状态与记忆,记住已尝试过的数据源,避免重复查询;
- 触达死胡同时可调用诊断工具,高风险场景则升级给人工介入。
实际项目里,在知识库问答与合规校验系统上加这套评估重试循环,能把"检索到了但答错"的问题拦在检索阶段。
把复杂任务拆给多个智能体:交接与群聊
单个 agent 承担多角色时,系统提示词越写越长,角色描述互相干扰,输出质量最先掉下来。多智能体方案的核心是按职责边界拆分,而不是简单增加模型调用。
- 每个 agent 只做单一角色(推荐、行程规划、预算管理),有独立的系统提示词与工具集;
- 交接(hand-off):当前 agent 判断请求超出自身职责时,把会话状态移交给更合适的 agent 继续;
- 群聊(group chat):多个 agent 在共享会话中处理同一问题,由筛选器或协调者决定采用哪个结果;
- 协调者 agent 可充当路由入口,按请求类型分发任务。
实际项目里,当单 agent 的提示词膨胀到数百行、输出开始出现角色冲突时,先拆出职责边界最清晰的一个子 agent,而不是推倒重来。
给人工保留审批权:Human-in-the-loop 机制
agent 的能力边界由接入的工具决定,一旦挂上资金划转、删除数据、对外发邮件这类高风险工具,就不能允许它自动执行。
- agent 调用高风险工具前先暂停,把计划动作返回给人工确认;
- 审批结果写回会话,agent 据此继续执行或调整方案;
- 权限边界在系统层面显式声明:哪些工具自动执行、哪些需审批、哪些禁用;
- 审批记录留在 trace 中,为审计与复盘提供依据。
实际项目里,把工具按风险分三档,只对会写系统或产生费用的工具设置审批门,只读查询类工具直接放行,避免审批疲劳。
用差旅报销单走通端到端流程
10-ai-agents-production/code_samples/10-expense_claim-demo.ipynb是仓库里最接近真实业务的示例,完整链路按时间线如下:
- 输入:一张差旅票据图片,加上公司报销规则;
- 智能体动作:OCR agent 先读取票据,把金额、日期、商户、费用类型提取成结构化模型;email agent 再基于结构化数据生成报销邮件;最后把费用构成画成饼图;
- 中间问题:票据格式不统一,含税金额与币种字段经常含糊,模型直接誊抄会漏字段、错单位;
- 解决方式:agent 按任务上下文动态选择函数,提取结果经过结构化校验,字段不匹配 schema 就重新查询修正,而不是把脏数据抛给前端;
- 最终输出:一封可直接发出的报销邮件,加一张可归档的费用构成图。
这个例子的价值在于展示了多 agent 分工后,每一步的输出都成为下一步的受控输入。
从本地到生产:三档部署对比
| 档位 | 部署方式 | 关注指标 | 典型手段 |
|---|---|---|---|
| 本地 | venv + Jupyter,可用 Foundry Local 切本地模型 | 调用成功率、单次运行时长 | 按顺序跑 notebook 示例与冒烟测试 |
| 小流量 | 托管到 Foundry Agent Service 灰度 | 延迟、token 成本、工具调用错误率 | OpenTelemetry 埋点,单次运行成本看板 |
| 生产 | 多模型提供商互备、弹性扩缩 | 用户反馈、任务完成率、成本异常 | 自动化评估、告警、provider 回退 |
本地阶段用第 17 课的 Foundry Local 方案可以完全离线跑通;进入小流量后重点看单次运行的 token 成本与工具失败率;生产阶段则把自动化评估(如 LLM 打分、RAGAS 类指标)挂进 CI。
选择下一步入口
- STUDY_GUIDE.md:给出 18 课的学习顺序建议,适合需要路线规划的初学者;
- AGENTS.md:仓库的工程约定与设计实践,适合跑完示例后准备自建 agent 的开发者;
- 05-agentic-rag/README.md:详解检索自校验的机制与边界条件,适合准备做知识库问答系统的读者。
先把 10-ai-agents-production/code_samples/10-expense_claim-demo.ipynb 跑通,再把 OCR 环节换成推理更快的模型,对比单次运行延迟与 token 成本的变化,这是验证上面整套方法论最快的方式。
【免费下载链接】ai-agents-for-beginners18 Lessons to Get Started Building AI Agents项目地址: https://gitcode.com/GitHub_Trending/ai/ai-agents-for-beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考