news 2026/10/8 2:09:14

《AI Agent原理与实战》2026版 第1课 AI Agent 是什么:定义、分级与适用边界

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
《AI Agent原理与实战》2026版 第1课 AI Agent 是什么:定义、分级与适用边界

本文收录于专栏agent智能体系列—— 专栏系统覆盖 AI Agent 的记忆、工具、插件与实战,点击订阅可跟踪后续更新。

本课定位:如果你在学习 Agent 相关的东西,这篇课直接给你决策性建议:也许你已经熟悉 ChatGPT/DeepSeek 这类对话应用,但"Agent"和它们差在哪?本课先把这个被用滥的词钉死:一句话定义、三级分类、与 Workflow 的架构…分界线,最后给出"要不要用 Agent"的判定框架。学完你能准确判断手头任务是 Agent 问题还是普通工程问题——这是整门课的第一块基石。

阶段 1|概念与基础 | 来源:【微·1】(微软 AI Agents for Beginners 第 1 课)+ Anthropic《Building Effective Agents》 | 知识更新至 2026-10

关键字:AI Agent、智能体定义、大模型应用、Workflow、工具调用、记忆机制、自主智能体、Agent分级

本节目录

  • 1.1 一句话定义
  • 1.2 三级分类:从反应式到自主式
  • 1.3 Workflow vs Agent:架构分界线
  • 1.4 判定框架:三个维度

概念讲解

1.1 一句话定义

微软课程给出的是一个可用的工作定义:

AI Agent 是让大语言模型(LLM)真正"做事"的系统——通过给模型配备工具和知识,使其能对世界采取行动,而不只是回复文本。

微软原文把这句话拆成五个要素展开——其中第一个要素"系统"本身又含三个子件。以下按原文结构逐条吸收(贯穿示例沿用微软的旅行订票 Agent):

要素一:系统(System)——Agent 不是单个东西,而是协同工作的部件集合。微软强调"At its core, every agent has three pieces"(每个 Agent 的核心都是三件套):

子件含义旅行订票 Agent 示例
环境(Environment)Agent 工作所在的空间订票平台本身
传感器(Sensors)读取环境当前状态的方式查酒店余房、查航班价格
执行器(Actuators)对环境施加动作的方式订房、发确认函、取消预订

"传感器/执行器"借自经典 AI 的 Agent 定义(Russell & Norvig 教科书的 agent = 感知 + 决策 + 行动)。LLM 时代的新东西是:决策核心换成了能用自然语言推理、并输出结构化动作的大模型。

要素二:大语言模型(LLM)——Agent 早于 LLM 存在,但 LLM 才是现代 Agent 强大的原因:理解自然语言、结合上下文推理、把一个模糊的用户请求变成具体的行动计划。

要素三:执行动作(Perform Actions)——没有 Agent 系统时,LLM 只是生成文本;装进 Agent 系统后,LLM 能真正"执行"步骤——查数据库、调 API、发消息。

要素四:工具访问(Access to Tools)——Agent 能用哪些工具取决于两件事:(1)它运行的环境(2)开发者选择给它接什么。旅行 Agent 可以被允许查航班但不能改客户记录——全看接线时怎么配。

要素五:记忆 + 知识(Memory + Knowledge)——短期记忆(当前对话)与长期记忆(客户数据库、历史交互)。旅行 Agent 会"记得"你偏好靠窗座位。

五要素与本课程后续内容的对应:要素二、三 → 第 2 课(LLM 视角下的消息与调用);要素四 → 第 7/8/18 课(工具与协议);要素五 → 第 13/14 课(上下文与记忆);要素一的三件套如何组装成循环 → 第 6 课。

图源:微软 AI Agents for Beginners 第 1 课(aka.ms/ai-agents-beginners)。图中三分支对应 1.1 节五要素中的要素三/四/五;System 三子件(Environment/Sensors/Actuators)是承载这三者的运行底座,图未画出。

Anthropic 在《Building Effective Agents》(2024-12-19 发布)里补了一句更本质的刻画:

Agents are typically just LLMs using tools based on environmental feedback in a loop.
(Agent 通常不过是"在循环中基于环境反馈使用工具的 LLM"。)

这句话值得抄在本课扉页——它把 Agent 从营销叙事拉回到工程对象:一个循环,加上工具调用。第 6 课我们将亲手写出这个循环的 100 行以内版本。

1.2 三级分类:从反应式到自主式

按能力递增,本课程把 Agent 分为三级工作分类(微软课程原文用的是教科书式七类细分——简单反射 / 模型反射 / 目标驱动 / 效用驱动 / 学习型 / 分层 / 多智能体系统,见本课后附对照):

Level 1 Reactive(反应式) 输入 → 输出,一次调用,无工具无状态 Level 2 Tool-use(工具使用) 输入 → 模型决定调哪个工具 → 拿结果 → 再推理 Level 3 Autonomous(自主式) 给定目标,自行规划多步任务、持续执行、自我修正

三级之间的差异不是"模型大小",而是控制权归属:

  • 反应式:每轮对话独立,系统完全由代码路径决定。你每天用的"聊天助手"基本在这一级。
  • 工具使用式:模型在"下一步做什么"上获得决策权——查数据库、调 API、跑代码,结果回传给模型继续推理。控制权在代码与模型之间交替。
  • 自主式:模型拿到目标后自己拆任务、排顺序、判断完成与否,中途可以自主纠偏。控制权大体移交给模型,代码只负责提供工具和护栏(最大迭代数、预算上限、人工确认点)。

一个直观对照:问"帮我查一下订单 12345 到哪了"——

  • 反应式系统只能回答"我无法查询";
  • 工具使用式系统会调用query_order(12345)然后转述结果;
  • 自主式系统面对"查一下我上周那批迟到的订单、联系承运方催一下、把新 ETA 汇总发我"这种目标,会自己拆成查单→筛延期→调用催办→汇总四个动作。

三级与七类的对照:三级是七类的教学压缩——反应式 ≈ 简单反射/模型反射;工具使用式 ≈ 目标驱动(工具是其达成目标的手段);自主式 ≈ 目标驱动 + 学习型 + 分层/多智能体的组合形态。工程讨论用三级够用,读文献时需知七类细分(Russell & Norvig 教科书谱系)。

1.3 Workflow vs Agent:架构分界线

"是不是 Agent"在业界吵了一年多,Anthropic 给出了目前被最广泛采纳的判据——谁决定执行路径:

Workflow(工作流):LLM 和工具通过预定义的代码路径编排的系统。
Agent(智能体):LLM动态主导自己的流程和工具使用、掌控任务完成方式的系统。

判定问题可以压缩成一个:"下一步做什么"是谁定的?

问题WorkflowAgent
下一步做什么开发者预先写死(if/else、DAG)模型运行时自行决定
何时结束代码走到流程终点模型判断任务完成(或触发停止条件)
路径可预测性高,可穷举测试低,同输入可能不同路径
出错定位按流程节点排查需要看完整轨迹(trajectory)

两个常见误区:

  1. “带工具调用的就是 Agent”——错。一次"模型→工具→模型"的固定管道仍是 workflow(预定义路径:必调这个工具)。工具调用是 Agent 的必要条件,不是充分条件。
  2. “Agent 一定更高级”——错。能写死的流程就不该让模型自由发挥(见第 4 课的决策框架)。Anthropic 的原话是"find the simplest solution possible"。

1.4 判定框架:三个维度

微软第 1 课的原则开门见山:“Just because youcanuse an AI Agent doesn’t mean you alwaysshould”(能用不代表该用),并列出 Agent 真正发挥价值的三种情形——开放性问题(步骤无法预先编程,需要 LLM 动态找路径)、多步流程(跨多轮使用工具而非单次查询)、持续改进(基于用户反馈或环境信号变聪明)。把这三条与 Anthropic 的成本视角合并,本课程用三个维度判断该做到哪一级:

① 任务复杂度

  • 步骤能否事先枚举?能枚举 → workflow;不能枚举、依赖中间结果动态分支 → 考虑 Agent。
  • 模型能否可靠判断"信息够了/还缺什么"?这是 Agent 自主检索的前提。

② 容错要求

  • 错一步的代价是"重新生成一版文案"还是"给客户错退款"?后者必须加确认闸门或干脆降级为 workflow + 人工审批。

③ 执行成本

  • Agent 每步都要过一次模型:token 费、延迟、失败重试都是线性甚至超线性增长。单次 LLM 调用能解决的,绝不进循环。

三维度都倾向 Agent 的典型信号:任务开放性高(步骤不可预知)、单步错误可恢复、单位任务价值高(值得烧 token)——深度研究、代码工程、数据分析是当前最成熟的三类。这三条信号与微软第 1 课的"shines 场景"一一对应(开放性问题/多步流程/持续改进),而微软同时强调这些判断会放到后续"Building Trustworthy AI Agents"一课深挖(本课程第 25 课,同样建议提前学)。

案例实战:企业知识助手的边界判断(示意场景,需求形态取自常见企业信息化需求)

目标:一家制造企业要建内部知识助手,判断各子需求分别落在哪一级,避免"全上 Agent"的过度设计。

背景:需求方提出三个场景——

  • 场景 A:员工问"差旅报销标准是什么?"
  • 场景 B:查"我上个月的报销单走到哪一步了"
  • 场景 C:“把这季度所有超期的采购订单找出来,分析延期原因归类,输出一份带责任人的报告”

步骤一:逐场景过三维度

场景步骤可枚举?容错要求成本敏感度判定
A 查制度是(检索→生成两步)低(有原文兜底)高(高频)RAG workflow,非 Agent
B 查进度是(固定 API + 生成)中(查错会误导)中workflow + 工具调用
C 出报告否(延期原因要动态归纳,订单数量不定)中(报告供人审)低(季度一次)自主式 Agent

步骤二:画出场景 C 的路径对比

Workflow 思路(写死): Agent 思路(模型主导): 拉全部订单 → 筛超期 → 目标:超期采购订单分析报告 按规则分类 → 套模板 ① 自查:先调 query_orders(status=delayed) ② 发现 3 类延期原因需要看每单备注 ③ 逐单取详情 → 归纳分类 ④ 对每类调 owner_lookup 找负责人 ⑤ 判断信息充分 → 撰写报告

区别在 ②③:延期原因的类别数事先不知道,workflow 要么硬编码猜测的分类规则,要么留人工;Agent 可以基于逐单观察动态归纳。而场景 A/B 里 Agent 没有任何发挥空间——强上 Agent 只是让流程更贵、更难测。

完整代码:本课不写代码(第 6 课统一动手)。这里给出可复用的判定记录表模板:

## Agent 适用性判定记录(模板) - 需求: - 步骤可枚举:是/否 → 依据: - 失败代价:低/中/高 → 具体后果: - 频次与成本:日均次数 × 每次预估 token: - 判定:反应式 / workflow / workflow+工具 / 自主 Agent - 若 Agent,护栏:最大迭代数?预算上限?哪些动作需人工确认?

预期输出:一份每场景一行的判定表 + 护栏清单。真实项目里,这张表应写进设计文档并在评审时逐行过——"为什么要 Agent"的举证责任在建设方。

小结

  • Agent = LLM + 工具 + 循环 + 环境反馈;本体是"系统"而非单个模型。
  • 三级分类(Reactive / Tool-use / Autonomous)的实质是控制权从代码向模型的转移。
  • Workflow 与 Agent 的分界:"下一步做什么"由预定义代码还是模型动态决定(Anthropic 口径)。
  • 判定用三维度:任务复杂度、容错要求、执行成本;最简方案优先。
  • 本课的判定框架在第 4 课将扩展为完整决策树;Agent 的核心组件总览见第 5 课《Agent 系统解剖》。

扩展阅读

🌐 网络提示:github.com 需代理(clone 可走 ghproxy 加速、push 优先 SSH);anthropic.com 需代理(核心结论已摘进本课正文)。详见总纲附录《国内网络访问与国产适配指南》。

  • 微软 AI Agents for Beginners 第 1 课(含视频与多语言翻译):https://github.com/microsoft/ai-agents-for-beginners/tree/main/01-intro-to-ai-agents (仓库 73.8k star,2026-10-01 检索)
  • Anthropic《Building Effective Agents》:https://www.anthropic.com/engineering/building-effective-agents (workflow vs agent 定义原文)
  • Russell & Norvig《Artificial Intelligence: A Modern Approach》第 2 章(Agent 的经典感知-行动定义)

我的专栏

蛋白 / 抗体 / 多肽 / 核酸分子模拟 / 动力学 / 对接药物 / 设计 / 案例AI / Agent / 大模型
开源蛋白结构预测分子模拟基础小分子药物设计案例AI Agent系列
开源蛋白生成方法实践分子动力学模拟-Amber蛋白药物设计案例化学大模型
开源多肽设计模型分子动力学模拟-Gromacs多肽药物设计案例《AI Agent原理与实战》
开源多肽性质预测分子动力学模拟-OpenMM开源小分子生成设计CADD中的机器学习模型
DNA/RNA药物设计結合自由能开源药代动力学软件高效计算配置
siRNA药物设计模型UCSF DOCK系列我胡师兄说药
ASO药物设计模型rDock系列 LeDock系列 gnina系列
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 2:09:03

【赵渝强老师】崖山数据库的行地址ROWID

崖山数据库的ROWID高度兼容Oracle语法,是HEAP堆表的伪列,代表行的物理存储地址,同时也是一种原生数据类型。 ⚠️ 仅支持HEAP堆表;列存表、分布式部署场景不支持ROWID伪列。 视频讲解如下: 视频讲解如下 【赵渝强老师…

作者头像 李华
网站建设 2026/10/8 2:08:07

Doris 4.1 从理论到实践 —— 第 14 章 端到端综合项目车联网实时数仓

Doris 4.1 从理论到实践 —— 第 14 章 端到端综合项目车联网实时数仓 课程定位:本系列收官章。整合前 13 章知识,完成车联网 TSP(Telematics Service Provider)实时数仓端到端项目。包括业务背景、架构设计、数据源准备、四层数仓分层建表、Flink CDC 采集、Flink 实时计算…

作者头像 李华
网站建设 2026/10/8 2:07:42

小白程序员必看:大模型时代如何突破求职困境,找到高薪AI岗位?

文章指出当前初级程序员岗位大幅减少,主要原因是企业停止招聘而非裁员,AI技术加速这一趋势。市场对“翻译需求成代码”的初级程序员需求下降,但对能“判断需求如何拆解”的高级人才需求激增。建议求职者:1)反思经验中“…

作者头像 李华
网站建设 2026/10/8 2:07:04

零基础看懂大模型落地!RAG/Agent/微调/私有化部署核心能力全解析

很多初学大模型的小伙伴都会陷入一个误区:只会堆砌名词,不懂实际落地。看着网上五花八门的大模型技术,分不清RAG、Agent、微调、私有化部署到底有什么用、该怎么用、适合什么场景。 其实企业级大模型落地,核心就靠四大核心能力&am…

作者头像 李华