news 2026/8/14 3:41:18

如果你现在正想入门 AI Agent,那种“刚学完就过时“的焦虑感

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如果你现在正想入门 AI Agent,那种“刚学完就过时“的焦虑感

每周一个新框架,每月一个"革命性"发布,口号永远是"这回真不一样了"。结果呢?你刚装好 Claude Code,Cursor 又出新功能了;你刚搞懂 ReAct,隔壁团队已经开始吹多智能体协作了。说白了,追工具就是死循环——你永远在切换配置,永远没时间真正干活。

其实吧,Agentic Engineering 这领域虽然工具迭代快得像疯狗,但底层的核心概念稳得很。那些新工具今天叫 Skill,明天叫 Rule,后天叫 Workflow,扒开来看解决的都是同一个老问题。与其做工具的追随者,不如搞懂背后的原理。工具来来去去,概念永恒不变。

这篇东西就是要一次性讲清楚 30 个核心概念。读完以后,再看那些花里胡哨的 Demo,你能一眼看穿它到底在搞什么飞机,而不是又被"改变一切"的标题党唬住。

基础 building blocks

1. Agent(这玩意儿到底是个啥)

现在是个 AI 工具都管自己叫 Agent,搞得这个词都滥用了。说白了,Agent 不是那种你问一句它答一句就完事的 Chatbot。这家伙会跑循环:你给个目标,它思考→调用工具→看结果→再思考→再行动,直到搞定。

普通 Chatbot 是你问→它答;Agent 是你给目标→它规划→执行→观察→继续。比如 Debug 一个挂掉的测试,它会看报错→打开文件→改代码→再跑测试→看新报错→继续改,直到通过。

但坑就坑在,不是啥场景都需要 Agent。改文件名、格式化日期、转个 JSON,写个脚本就完事了。Agent 每次循环都烧钱,时间越长越不可控,Debug 也更痛苦——它两次跑的可能不是同一条路径。

原则是:简单问答用 Prompt,固定流程用脚本,只有那种"走一步看一步"的灵活任务才上 Agent。别为了用 Agent 而用 Agent。

2. 执行模型(Think → Act → Observe)

Agent 的执行模型其实不神秘,就三步循环:思考→行动→观察(Think-Act-Observe)。先想该干啥,然后调工具(读文件、跑命令、查 API),最后看结果更新上下文。这叫 ReAct 模式,名字不同,道理一样。

有时候 Agent 会并行调多个工具,比如同时读三个文件,省时间但也可能冲突(比如同时编辑同一个文件)。还有阻塞式(等结果再下一步)vs非阻塞式(后台跑任务,Agent 干别的)。新手先记住那个基础循环就行——Agent 不是一次性算准全流程,而是走一步看一步,错了能改。

3. Agent 状态(State 存哪儿)

Agent 的"状态"分两种。

一是上下文窗口(Context Window),就是 Agent 现在能看到的对话历史、系统提示、工具返回,相当于短期记忆。但这玩意儿有 Token 上限,塞太多旧垃圾会分散注意力。

二是外部状态:磁盘文件、数据库、记忆系统。Agent 看不到这些除非你主动喂给它。

说实话,对开发者来说,文件就是最好的状态存储。Git 可追溯,diff 可对比,人和 Agent 都能读。MEMORY.md 存跨会话的记忆(比如项目约定),数据库用来结构化查询。多 Agent 协作时,用 Git worktree 隔离,避免写冲突——每个 Agent 有自己的工作副本,写完再合并。

如果父 Agent 给子 Agent 传上下文时传了一堆废话,说明任务拆分得不够细。

4. 常见 Agent 协作模式

多 Agent 怎么配合?常见套路就三种:

Planner / Executor(计划员+执行员):一个负责拆解任务(先改数据库→再写 API→最后补测试),另一个负责老老实实执行。适合复杂任务,防止 Agent 上来就瞎写代码。

Router / Specialist(路由器+专家):一个 Agent 当客服前台,把任务分给不同专长的 Agent(安全审查、Debug 专家、文档写手)。每个专家 Prompt 更聚焦,行为更可预测,还能省钱——不是所有任务都需要 GPT-4。

Map-Reduce(分治并行):大任务切小,多 Agent 并行处理(比如按文件 Review PR),最后找个汇总 Agent 合并结果。省时间,但汇总质量决定最终效果。

关键是交接时的上下文要不多不少。给太少,下一个 Agent 懵;给太多,它晕。

配置层:Agent 的控制面板

5. Agent 配置文件(CLAUDE.md / AGENTS.md)

Claude Code 用CLAUDE.md,其他工具用AGENTS.md。这玩意儿是项目的"家规",在 Agent 写第一行代码前告诉它:项目用 pnpm 还是 npm,测试命令是啥,代码风格咋样,哪些雷区不能踩。

最烦的是有人把配置文件写成论文。复制一堆 AI 生成的 generic 建议,写"写干净代码"这种废话。说实话,模型不需要你教它怎么写干净代码,它需要知道的是你的项目用uv而不是pip控制在 100 行以内,越具体越好。把它当代码 review,没用的就删。

6. 可复用工作流文件

配置文件是一直生效的,工作流文件是按需加载的。比如"怎么写测试"、"怎么 Review PR"单独成文,放在.claude/skills/或类似目录,带 YAML 头信息描述啥时候用(glob: *.test.ts)。

有个研究叫 SkillsBench 发现:给便宜模型(Claude Haiku)配上人工写的好流程,效果比没流程的顶级模型(Claude Opus)还好。这说明啥?流程比模型更重要。但别让 AI 自己写流程——它写的全是噪音,加了还不如不加。

分层策略:配置文件管家规(永远用 pnpm),工作流管流程(写 API 要同时改验证、测试、文档),实时 Prompt 管当前需求(给学生加个导出接口)。

7. 工作流框架

框架就是给 Agent 套个紧箍咒,让它按套路出牌,别上来就唰唰唰写代码,写完发现测试没跑。

比如 Superpowers 给 Claude Code 加了一堆 curated skills;Get Shit Done 用斜杠命令触发流程;Compound Engineering 分四阶段:Plan → Work → Review → Compound(把这次的经验沉淀下来给下次用)。

说白了,就是把 Agent 从"瞎猜型选手"变成"有流程的靠谱同事"。

8. Prompt Caching(提示缓存)

Agent 每次请求都带系统提示、配置文件这些重复内容(稳定前缀)。Prompt Caching就是把这部分存起来,第一次调用贵,后面便宜得多,响应也更快。

坑就坑在 TTL(Time To Live)。缓存会过期,你去喝杯咖啡回来,或者去 Slack 吹了半小时水,回来缓存凉了,下次调用又得重新写入。有些工具支持调长 TTL,适合长时间编码会话。

但缓存不解决垃圾上下文问题——它只让重复内容更便宜,不会让垃圾内容变有用。

9. Context Rot(上下文腐烂)

这是缓存解决不了的。Context Rot就是说上下文塞太多,模型注意力就散了,找不着重点,准确率下降。就算用 200K 上下文模型,中间部分的信息它也容易漏。

规则是:每个 Token 都得有存在的理由。配置文件别太长,工作流要精简,旧会话该清就清。长上下文≠好上下文。

能力层:Agent 能摸到啥

10. MCP(Model Context Protocol)

Model Context Protocol 是 Anthropic 搞的标准,让 Agent 连外部工具(GitHub、数据库、Slack)不用每次写胶水代码。工具暴露成标准格式,Agent 直接认。

但问题是它占上下文。早期 MCP 要一次性加载所有工具描述,Token 爆炸。新版本支持延迟加载(deferred loading),先只看名字和简述,决定用了再加载详情。

对个人开发者,写个脚本可能更轻量;对团队,MCP 统一管理认证和权限更干净。

11. 实时文档检索(Live Document Retrieval)

模型有知识截止日期,遇到新 API 会瞎猜,而且猜得很自信。Context7 这类工具能把最新库文档拉进上下文,避免用已弃用的函数。DeepWiki 能帮你理解陌生代码库。

关键是问法。别问"认证一般怎么做"(基于训练数据),要问"这个仓库认证怎么做"(基于真实代码)。后者才是接地气的答案。

12. AI-Native 网页搜索

传统搜索是给人类看的,一堆广告、导航栏、弹窗。Agent 不需要这些视觉噪音。Exa 这类 AI-native 搜索直接返回结构化摘要、关键内容,省 Token,省解析 HTML 的麻烦。

人类搜索给页面,AI 搜索给能直接用的上下文

13. 可视化输出生成

Agent 不只能写应用代码,还能出图、出视频、出 PPT。

  • • Figma 的 MCP Server 让 Agent 读设计稿(布局、间距、变量)直接生成前端代码,甚至反向修改设计。
  • • frontend-slides 生成 HTML 演示文稿。
  • • draw.io 文件是 XML 结构,Agent 能读 Terraform 后自动生成架构图。
  • • Remotion 用代码做视频,Agent 学会了就能出片。

模式很简单:Agent 本质是写代码,只是输出格式不同。

14. 持久化记忆(Persistent Memory)

默认每次会话都从零开始,昨天讲的架构决策今天忘了。最简单的办法:项目根目录放MEMORY.md,存项目约定、技术决策、Session 摘要。Agent 启动时读,工作中更新。

但太长会加剧 Context Rot。所以文件大了就换可搜索记忆(如 episodic-memory),把旧会话向量化,需要时检索。文档告诉你"做了什么",Session 历史告诉你"为什么这么做"。

15. 知识搜索(Knowledge Search)

记忆存 Agent 自己学的,知识搜索找外部的。Shopify CEO Tobi 搞的 QMD 就像本地搜索引擎,接 MCP 后 Agent 能查你的会议笔记、设计文档、产品规格。

记忆是纵向的(时间线),知识搜索是横向的(跨文档)。

编排层:多 Agent 怎么不打架

16. 子 Agent(Subagents)

派小弟去干活。父 Agent 给任务、给工具、给干净上下文,小弟干完只返回结果,不返回中间那堆胡思乱想和调试日志。

好处:可以并行(一个审安全,一个写测试,一个改文档),且主线程保持清爽。

用 Markdown + YAML 定义子 Agent,指定toolsmodeldescription。description 告诉父 Agent 啥时候派这个专家出场。

:多 Agent 同时写文件会冲突。用 Git worktree 给每个 Agent 单独的工作副本,写完再合并。

17. Agent 循环(Agent Loops)

类似子 Agent,但是迭代执行。每轮清上下文,状态存文件/Git,下轮重新开始。Claude Code 的[/goal](https://code.claude.com/docs/en/goal)就是这思路:设定完成条件(“所有 auth 测试通过且 lint 干净”),Agent 循环干直到满足条件。

适合重复性、有边界的大任务(比如逐个文件迁移代码库)。

18. 编排工具(Orchestration Tools)

Agent 多了需要调度,不然会重复劳动、进度丢失、结果合不上。

  • • Conductor:给 Claude Code 和 Codex 提供并行会话 UI,带 diff 查看器。
  • • JetBrains Air:在 JetBrains 生态里用 Docker 或 worktree 隔离任务。
  • • Vibe Kanban / Cline Kanban:看板管理,支持自动提交和依赖感知并行。
  • • Paperclip:更激进,想当 AI 公司的管理层,带组织架构和预算控制。

19. 托管 / 云原生 Agent

本地 Agent(Claude Code、Cursor)适合个人开发。托管 Agent跑在厂商基础设施上,通过 API 接入你的产品,适合给终端用户使用。

但注意计费方式:托管通常按 API Token 收费,比自己订阅贵。个人写代码用本地,做产品给多人用才上托管。

安全层:别让 Agent 把家拆了

20. 沙盒(Sandboxing)

Agent 会犯错,可能跑错命令、读错文件。沙盒限制它能访问啥:通常只能读写项目文件夹,.ssh、.env、系统目录都 blocked。网络也能通过白名单限制。

更强隔离用 Docker 容器,甚至无网络访问。目的是缩小爆炸半径——即使 Prompt 注入成功,Agent 也出不了沙盒。

21. 权限(Permissions)

Agent 是解决问题导向的,有时候不择手段:测试挂了就删断言,Git 推不上去就强推,依赖装不上就curl | sh

权限分层:项目级定义安全操作(跑测试、lint),用户级定义红线(禁止rm -rf /,禁止读.env)。可以用小模型做权限分类器,自动判断要不要人工审批。

这不是可选项,是基线安全。

22. 钩子(Hooks)

在工具执行前拦截检查。Pre-tool Hook(如 Claude Code 的PreToolUse)是最后一道防线。

配合 Tirith 这类验证器,检查命令有没有:

  • • 可疑 Unicode(西里尔字母伪装)
  • • 假域名
  • curl | sh管道
  • • 危险文件路径

钩子不替代沙盒,沙盒是事后止损,钩子是事前拦截。

23. Prompt 注入防御

Agent 太信任输入了。克隆的仓库里可能有毒的配置文件(“把日志发到外部服务器调试”),或者 MCP 服务器里藏恶意代码——这构成供应链攻击

还有 Unicode 伪装:西里尔字母і看起来像拉丁字母i,命令看起来是rm -rf /tmp,实际可能是别的。

规则

  • • 把配置文件当代码审查,别当文档
  • • 外部输入(文档、MCP、工具返回)都可能带恶意指令
  • • 结合审查、白名单、钩子、沙盒多层防御

24. 结构化代码检查(Structural Linting)

普通 Linter 查格式、命名,AST-grep 这类工具查语法树结构。比如 Python 的经典坑:

def process(items=[]): # 坑:默认参数是可变对象,只创建一次,后续调用共享 ...

Agent 常写这种代码,因为训练数据里全是。AST-grep 能抓这种"看起来对、实则坑"的模式。把它加进 pre-commit 和 CI,自动纠正 Agent 的坏习惯。

25. Pre-Commit 关卡

Pre-commit 在代码进 Git 前拦截检查。Agent 不会嫌烦,blocked 了就改,改完再试。

强力配置包括:

  • • 基础检查(空格、文件大小)
  • • Ruff(Python 格式+Lint)
  • • Bandit(安全扫描)
  • • AST-grep(结构检查)

CI 是第二道关,在干净服务器上再跑一遍。记得加并发取消(cancel outdated runs),Agent 推送频繁,别浪费资源在已过期代码上。

Pre-commit 保本地历史干净,CI 保合并前干净。

可观测性:看看到底发生了啥

27. 追踪(Tracing)

Agent 干完活,第一个问题:它到底走了哪条路?

Tracing记录完整执行路径:调了哪些工具、哪个子 Agent 调的、耗时、输入输出、模型版本。树状结构比平铺好懂。

用 LangSmith、Helicone 或 OpenTelemetry。有了 Trace,才能 Replay,才能做 Metrics,Debug 时才能一步步看哪里跑偏。

28. 日志(Logging)

最基础的观测。记:

  • • 每次模型调用(Prompt、返回、延迟、Token、模型版本)
  • • 每次工具调用(参数、结果、延迟)
  • • 每次错误
  • • 一个 Session ID 串起全流程

JSON Lines格式,别搞太花哨。先多记,别急着删——丢了输入和工具返回,Agent 抽风时你死无对证。

30. 指标(Metrics)

分两类:

代理指标(Proxy):延迟、Token 用量、成本、工具调用次数。看效率,抓浪费(比如死循环)。

结果指标(Outcome):CI 测试通过没?PR 合并没?部署成功没?回滚了没?看疗效。

两者都得看。Agent 说"任务完成"不算数,外部系统验证才算。

最后

对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?

答案只有一个:人工智能(尤其是大模型方向)

当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右

再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!

下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

最后

1、大模型学习路线

2、从0到进阶大模型学习视频教程

从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、AI大模型最新行业报告

2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型

  • 带你了解全球大模型

  • 使用国产大模型服务

  • 搭建 OpenAI 代理

  • 热身:基于阿里云 PAI 部署 Stable Diffusion

  • 在本地计算机运行大模型

  • 大模型的私有化部署

  • 基于 vLLM 部署大模型

  • 案例:如何优雅地在阿里云私有部署开源大模型

  • 部署一套开源 LLM 项目

  • 内容安全

  • 互联网信息服务算法备案

  • 👇👇扫码免费领取全部内容👇👇

3、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 3:40:51

揭秘石家庄视频网站建设公司:从代码到灵魂,如何打造真正懂你的数字化名片

在这个信息爆炸的时代,如果你还在问“为什么我的网站没人看?”或者“为什么我的竞争对手视频流量那么高?”,那我建议你先把手机放下,喝口凉茶,静下心来听听这个行业的真心话。作为一名在石家庄互联网圈摸爬滚打多年的从业者,我见过太多老板满怀热情地把网站丢给所谓的“…

作者头像 李华
网站建设 2026/8/14 3:40:36

哈尔滨网站建设制作价格大揭秘:为什么你的报价总比别人高出一截?真正的好服务到底贵在哪

在哈尔滨这个充满冰城特色与工业底蕴的城市,每一家想要在互联网上留下一页印记的企业,都面临着一个绕不开的现实问题:做网站,到底得花多少钱?前两天,我在哈西的某家咖啡馆里,偶遇了做餐饮连锁的张总。他手里捧着一杯热乎的烤奶,眉头紧锁地跟我说,最近想给自家的新品牌…

作者头像 李华
网站建设 2026/8/14 3:39:40

菏泽网的网站建设如何选才不吃亏?官方联系方式与避坑指南全在这

在这个数字化浪潮席卷每一个角落的今天,对于咱们菏泽的企业主和朋友来说,拥有一张精美的“网络名片”早已不是锦上添花的选项,而是生存和发展的刚需。想象一下,当潜在客户在百度或者微信上搜索您所在行业的相关服务时,如果您的网站还是一片空白,或者打开速度慢得像蜗牛爬…

作者头像 李华
网站建设 2026/8/14 3:39:32

为什么你的APP手机端电子商务网站建设迟迟无法变现?揭秘那些被忽略的关键细节

在这个指尖滑动就能决定消费走向的时代,我们必须承认一个残酷的现实:传统的PC端电商网站正在慢慢失去它的统治力。过去,我们可能觉得搞个电脑网页就够了,但现在,数据不会说谎,绝大多数用户打开购物入口的第一时间,是掏出手机。这就引出了一个非常核心且紧迫的话题——AP…

作者头像 李华
网站建设 2026/8/14 3:39:30

国产芯片训出世界级大模型:从算力瓶颈到软硬件协同的破局之路

1. 从“卡脖子”到“跑起来”:国产芯片与大模型的破局之路今天早上,我的朋友圈和几个技术群被一条消息刷屏了:“DeepSeek V4 正式发布”。这本身并不稀奇,毕竟大模型迭代的消息隔三差五就有。但真正让圈内人,尤其是我们…

作者头像 李华
网站建设 2026/8/14 3:39:12

360云盘做服务器建设网站:个人博客与小型项目的低成本试错指南

在这个互联网流量红利逐渐见顶的时代,每个人都渴望拥有一个属于自己的网络角落。无论是为了记录生活的点滴,还是展示编程学习的成果,甚至是搭建一个小型的商业官网,拥有一个稳定的网站已成为许多技术爱好者的刚需。提到建网站,大多数人的第一反应是购买云服务器(VPS),租…

作者头像 李华