目录
1. 人工智能概述
2. 大语言模型(LLM)
3. Prompt 工程
CO-STAR 结构化框架(实用模板)
提示词工程技巧
4. Token
5. 会话记忆与上下文窗口
6. 多模态:文本、图像、音频、视频的融合
7. RAG(检索增强生成)
8. Tool Calling 与 MCP
Tool Calling(工具调用)
MCP(Model Context Protocol)
MCP 核心组件:
MCP 工作流程(4 步)
Tool Calling vs MCP
9. Agent 与工作流(Workflow)
10. Tool Calling 与 Skill
11. Vibe Coding 与 Copilot/Agent 模式
1. 人工智能概述
人工智能(AI),目标是用计算机系统模拟人类智能,实现学习、推理、决策等认知活动
本质是算法 + 数据,让机器具备类人能力
你每天刷短视频,平台知道你喜欢什么 —— 这是 AI 在“学习”和“预测”;
你跟 Siri 说句话,它能听懂 —— 这是 AI 在“听”和“说”;
拍照自动美颜、翻译文字 —— 这是 AI 在“看”和“理解”;
输入文字生成一段视频 —— 这是 AI 在“理解并创作”;
汽车自己开 —— 这是 AI 在“思考”和“决策”
三者的关系
- 人工智能(AI):目标,让机器有类似人类的智能
- 机器学习(ML):AI 的核心实现方式,通过数据训练模型自动学习规律
(线性回归、决策树、SVM 等) - 深度学习(DL):ML 的重要分支,基于多层神经网络,自动从海量数据中提取特征
一句话:DL ⊂ ML ⊂ AI
2. 大语言模型(LLM)
LLM(Large Language Model),基于海量文本训练,能理解和生成人类语言的模型
| 模型系列 | 开发方 | 特点 |
|---|---|---|
| GPT 系列 | OpenAI | 顶级多模态,超强推理,原生音视频处理 |
| Claude 系列 | Anthropic | 擅长编程辅助、长文档处理、拟人化对话 |
| Gemini 系列 | 多模态,搜索引擎与对话系统融合 | |
| GLM | 智谱 AI | 高效上下文理解,本土化语言优势 |
| 通义千问 | 阿里 | 全栈 AI,与阿里云生态深度绑定 |
| 混元 | 腾讯 | 企业级安全,微信/腾讯云生态打通 |
| 云雀/豆包 | 字节 | 驱动豆包 AI,与抖音/头条生态集成 |
| DeepSeek | 深度求索 | 国产“推理之王”,推理强,成本效益高 |
3. Prompt 工程
提示词(Prompt ),是用户或系统给 LLM 的指令/文本,用于引导模型生成特定输出
| 类型 | 定义 | 核心功能 | 示例 |
|---|---|---|---|
| 用户提示词 | 终端用户直接输入 | 传达即时需求(提问、指令) | “查询订单” |
| 系统提示词 | 开发者预设,嵌入后端 | 定义角色、行为规范、知识边界、安全过滤 | “你是一名客服,用友好语气解答问题” |
系统提示词像“操作系统”,持续影响所有交互;用户提示词像“操作指令”,驱动单次任务
CO-STAR 结构化框架(实用模板)
| 缩写 | 含义 | 说明 |
|---|---|---|
| C | Context(背景) | 提供足够背景,帮助 AI 理解任务上下文和环境 |
| O | Objective(目标) | 明确希望 AI 完成的具体目标 |
| S | Style(风格) | 指定生成内容的风格(正式、幽默、小红书风等) |
| T | Tone(语气) | 确定语调(礼貌、说服性、激励性等) |
| A | Audience(受众) | 描述目标受众(年龄、兴趣、职业等) |
| R | Response(响应格式) | 指定输出格式(表格、段落、列表等)及具体约束 |
示例(美食短文 Prompt):
- 角色:资深美食专栏作家
- 背景:微信公众号,读者 20-35 岁,晚 9 点饿,西安肉夹馍
- 任务:写 300 字短文,突出“馍酥脆、肉软烂”
- 输出格式:标题≤15字,正文分3段
- 风格:市井烟火气,口语化,短句,禁用陈词滥调
提示词工程技巧
基础技巧:
- 角色提示:设定身份(“你是一位 Python 架构师”),约束语气和专业深度
- 结构化指令:用分隔符(“”、【】、XML 标签)、列表、Markdown 清晰界定各部分
- 少样本提示:提供 1~3 个正确示例,让模型快速学习格式
进阶推理技巧:
- 链式思考(CoT):让模型分步推理,先思考再输出,提升复杂问题准确率
- 示例:请一步步推理以下问题,展示完整思考过程,最后得出结论:……
- 自我一致性:多次独立推理,投票得出最终答案,避免“一次思考定生死”
优化策略:
- 迭代式精炼(Iterative Refinement):从简单指令开始,逐步添加约束条件,观察输出并优化
4. Token
Token 是 LLM 处理文本时的最小语义单位,由分词器将文本拆分而成
不同模型分词器不同,同一个词可能被拆成不同的 Token
- Prompt Token / Input Token:发给模型的内容(问题、历史对话、上传文档、系统提示词)
- Completion Token / Output Token:模型生成的回答
Token 的三大作用
- 计费单位:几乎所有商用大模型按 输入 Token + 输出 Token 收费
- 上下文长度限制:模型有最大上下文窗口(如 8k、32k、128k、1M),超限会截断或报错
- 决定理解能力与成本:Token 切分合理性直接影响语义理解,数量影响推理速度、显存占用
5. 会话记忆与上下文窗口
- 会话记忆(Chat Memory):模型对历史对话内容的存储与利用机制,让对话连贯、减少重复输入、实现个性化体验和多轮任务完成
- 上下文窗口(Context Window):大语言模型在单次前向传播(一次推理或训练步骤)中,能够处理的输入 Token(Prompt) + 输出 Token(Completion)的总和上限
上下文窗口 = 背包容量;当前输入 + 会话记忆 + 系统提示词 = 你要装进去的东西
如果三者总 Token 数 + 输出 Token 超过窗口,就必须截断或触发遗忘
6. 多模态:文本、图像、音频、视频的融合
多模态,指融合多种类型信息,让模型能理解、生成不同模态数据。单模态只能处理一种
| 常见模态 | 典型应用 |
|---|---|
| 文本(Text) | 智能问答、文档分析 |
| 图像(Image) | 医疗影像分析、AI 绘画、商品描述生成 |
| 音频(Audio) | 语音助手(语音→文本→LLM→语音) |
| 视频(Video) | 视频摘要、行为识别、安防监控 |
7. RAG(检索增强生成)
RAG 解决三大问题
- 知识过时:训练数据有截止日期,RAG 可接入最新文档、实时数据
- 幻觉:模型容易“编答案”,RAG 基于真实文档回答,可溯源
- 私有知识:模型不知道企业内数据、业务规则,RAG 接入知识库实现“专属 AI”
此外还能节省 Token(只检索相关片段),并提升可解释性(返回引用来源)
RAG 核心工作流程
| 阶段 | 步骤 | 具体操作 |
|---|---|---|
| 离线准备 | 1. 数据采集 | 文档(PDF/Word/Markdown)、数据库、API、网页 |
| 2. 文档切分(Chunking) | 拆成小块,提高检索精度,适配上下文窗口 | |
| 3. 向量化(Embedding) | 将每个 chunk 转换为向量 | |
| 4. 存入向量数据库 | 存储向量 + 原文 + metadata(常用 Milvus、Pinecone) | |
| 在线查询 | 1. 问题向量化 & 检索 | 用户问题转向量,在向量库中相似度搜索(余弦相似度、向量距离) |
| 2. 重排序(可选) | 用更强模型对检索结果重新排序,筛选最相关内容 | |
| 3. Prompt 构建 & 生成 | 将检索结果 + 用户问题组合成完整 Prompt,调用 LLM 生成答案 |
8. Tool Calling 与 MCP
Tool Calling(工具调用)
指 LLM 能根据用户请求,智能选择并调用外部工具(函数、API、服务等),扩展自身能力
- Function Calling 是 Tool Calling 的早期叫法,特指调用代码中的函数
- Tool Calling 是更广泛的概念,涵盖 API、数据库、浏览器等任意外部操作
MCP(Model Context Protocol)
MCP 是LLM 与外部系统交互的标准化协议,类比 AI 领域的“USB-C”
核心价值:解决 “N 个模型 × M 个工具” 的集成复杂度问题
以前每个模型对接每个工具都要单独开发适配逻辑,现在只要遵循 MCP 标准,即插即用
MCP 核心组件:
MCP 采用的是“客户端-宿主-服务器”(Client-Host-Server)三层架构
- MCP Host 就是运行 AI 能力的应用程序本身。比如 Claude Desktop、Claude Code、Visual Studio Code,或者你自己搭建的 AI Agent 应用
Host 的职责是:
- 创建和管理多个 MCP Client 实例
- 控制 Client 的连接权限和生命周期
- 执行安全策略和用户授权
- 协调 AI/LLM 的集成
- 跨多个 Client 聚合上下文
- MCP Server 是一个独立的程序,向 MCP Client 提供特定的上下文和能力
MCP Server 的核心职责:
| 职责 | 具体说明 |
|---|---|
| 暴露 MCP 原语 | 通过 Tools(工具)、Resources(资源)、Prompts(提示模板)三种原语提供能力 |
| 独立运行 | 每个 Server 聚焦于明确、单一的能力边界,可独立部署 |
| 请求采样(Sampling) | 可通过 Client 接口请求 Host 侧的 LLM 进行采样 |
| 遵守安全约束 | 只能访问被授权的内容,不能读取完整对话历史 |
| 本地或远程部署 | 可以是本地进程(stdio 传输)或远程服务(HTTP 传输) |
Server 暴露的三种原语:
| 原语 | 控制方 | 说明 | 示例 |
|---|---|---|---|
| Tools(工具) | 模型控制 | 暴露给 LLM 执行操作的函数 | API POST 请求、文件写入、数据库查询 |
| Resources(资源) | 应用控制 | 通过 URI 访问的上下文数据 | 文件内容、Git 历史、数据库记录 |
| Prompts(提示模板) | 应用控制 | 预定义的提示消息模板 | 带参数的问题模板、角色设定模板 |
- MCP Client 是运行在 Host 内部的组件,由 Host 创建,负责与一个 MCP Server 建立和维护一对一的连接
关键特征:一个 Client 只连接一个 Server,一对一关系
MCP Client 的核心职责:
| 职责 | 具体说明 |
|---|---|
| 建立有状态会话 | 与每个 Server 建立一个有状态的会话(stateful session) |
| 协议协商与能力交换 | 在初始化阶段与 Server 协商协议版本和双方支持的能力 |
| 双向路由协议消息 | 在 Host 和 Server 之间双向传递 JSON-RPC 消息 |
| 管理订阅和通知 | 处理 Server 的订阅请求和实时通知 |
| 维护安全边界 | 隔离不同 Server 之间的连接,防止互相“窥探” |
MCP Server 获取渠道:
- 官方 Registry:https://registry.modelcontextprotocol.io
- 国内云厂商:阿里云百炼 MCP 广场、腾讯云 MCP 广场
- 社区平台:mcp.so、ForAgents.dev
MCP 工作流程(4 步)
- 初始化连接:MCP 主机启动,Client 与 Server 建立通信
- 能力发现:Client 向 Server 查询工具列表(名称、描述、参数、权限),同步给 LLM
- 执行决策与调用:LLM 判断是否调用工具,若需调用,Client 将结构化请求转发至 Server,Server 执行并返回结果
- 结果回传与输出:Client 将执行结果回传 LLM,模型融合后生成自然语言回答
Tool Calling vs MCP
| 维度 | Tool Calling | MCP |
|---|---|---|
| 本质 | LLM 调用外部工具的能力 | LLM 与工具交互的标准化协议 |
| 范围 | 偏向单一操作(查天气、查数据库) | 覆盖工具发现、调用、结果返回的全流程 |
| 集成方式 | 每个模型 + 每个工具需单独适配 | 统一接口,Client 与 Server 分层解耦 |
| 标准化程度 | 各厂商实现不同,缺乏统一规范 | 开源标准,跨模型、跨工具互通 |
9. Agent 与工作流(Workflow)
| 对比维度 | Workflow(工作流) | Agent |
|---|---|---|
| 流程控制 | 人预先定义步骤,固定顺序 | LLM 根据目标动态控制走向 |
| 灵活性 | 可预期,适合确定性任务 | 自适应,适合开放性任务 |
| 决策主体 | 人设计规则,固定流程 | LLM 自主决策 |
多 Agent 模式:将复杂任务拆给多个职责不同的 Agent 协作完成
何时需要多 Agent 而非单 Agent?
- 任务复杂到单 Agent 无法稳定完成时
- 上下文限制:单 Agent 塞入所有信息会超窗口、成本剧增、速度下降
- 角色冲突:同时扮演多角色导致提示词冲突,行为混乱
- 单点故障:某一步出错,整个任务链崩溃
10. Tool Calling 与 Skill
| 维度 | Tool Calling | Skill |
|---|---|---|
| 粒度 | 单一操作(查天气 API) | 完整任务能力(规划旅行:查天气+查机票+查酒店+生成行程) |
| 特点 | 原子化,可被组合 | 封装好的可复用能力,包含多个工具调用逻辑 |
常用 Skill 平台:
- ClawHub(OpenClaw 官方)
- llmskills.org(Claude 用户友好)
- SkillsMP(12 万+ GitHub 开源 Skill)
- 腾讯 SkillHub、阿里云官方 Skill 平台
11. Vibe Coding 与 Copilot/Agent 模式
- Vibe Coding:用自然语言驱动开发,开发者描述意图,LLM 自动生成/修改代码,开发者验收、反馈、迭代。代表工具:Cursor、Windsurf、Trae,以及 CLI 工具(Claude Code、Aider、Cline)
- Copilot 模式:AI 作为“副驾驶”,提供建议,最终决策权在人(如普通 ChatGPT 问答)
- Agent 模式:AI 自主规划并调用工具完成执行(如智能客服帮你订机票)
| 层级 | 核心问题 | 关键概念 |
|---|---|---|
| 概念层 | 是什么? | AI、ML、DL、LLM、多模态 |
| 交互层 | 怎么问? | Prompt、Token、会话记忆、上下文窗口 |
| 增强层 | 怎么让回答更准? | RAG、向量数据库、Embedding |
| 行动层 | 怎么让 LLM 做事? | Tool Calling、MCP、Skill |
| 系统层 | 怎么构建智能体? | Agent、Workflow、多 Agent、OpenClaw、Hermes |