第 3 章 主流 AI 工具分类全景
摘要:本章帮你建立对 AI 工具的全景认知。先按能力形态(文本 / 图像 / 视频 / 语音 / 编程 / 数据分析等十大类)和应用场景(创作 / 办公 / 学习 / 开发 / 营销 / 企业 / 服务 / 自动化八大类)给工具分类;再掌握五步决策框架(明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用);最后通过国际与国内速览表和两个实战走查(淘宝促销海报、金融数据不出境),学会在具体需求下快速锁定合适的工具组合。
本章目标:帮你建立对 AI 工具的全景认知,做到“看到需求,就能大致判断该用哪一类、哪一款工具”。读完本章,你不再会在成百上千款工具里迷路。
3.0 学习目标学完本章,你应该能够:
- 按能力形态识别工具:看到“文本 / 图像 / 视频 / 语音 / 编程 / 数据分析”等类别时,能说出这类工具是干什么的、有哪些代表产品。
- 按应用场景归类需求:把“写文案、做海报、剪视频、写代码、开周会”等日常任务,映射到对应的工具场景。
- 套用决策框架做选择:掌握“明确需求 → 选类别 → 筛工具 → 试用 → 组合”的五步决策框架,不再凭感觉乱试。
- 判断国际 vs 国内取舍:知道什么时候优先用国内合规工具,什么时候国际工具更合适。
面对市面上成百上千款 AI 工具,零基础用户最大的困惑往往是:“到底该选哪个?”答案的第一步,是先给工具“分个类”。本章从三个维度帮你搭起认知框架:按能力形态分、按应用场景分、按决策框架选,最后再补一个实用的“国际与国内速览表”。
3.1 按能力形态分类(工具“能做什么”)
这是最直观的分类方式——看工具处理的是哪种信息形态。大纲把能力形态分为十大类,我们逐一通俗说明:
| 类别 | 一句话解释 | 典型用途 | 代表工具 |
|---|---|---|---|
| 文本/对话类 | 你打字、它说话,像聊天一样帮你写和想 | 写文案、答疑、翻译、头脑风暴 | ChatGPT / 豆包 / DeepSeek / Kimi |
| 图像生成类 | 你描述一句话,它画出一张图 | 海报、插画、头像、概念图 | Midjourney / 即梦 / 通义万相 |
| 图像识别类(CV) | “看懂”图片里的内容 | 文字识别(OCR)、人脸检测、瑕疵筛查 | 百度智能云视觉 / Google Vision |
| 视频类 | 文生视频、图生视频、AI 剪辑 | 短视频、广告片、教学片 | Sora / 可灵 / 剪映 |
| 语音类 | 听(语音转文字)和说(文字转语音) | 会议转写、配音、有声书 | 讯飞听见 / Whisper / ElevenLabs |
| 编程辅助类 | 帮你写代码、改 Bug、理解项目 | 开发、调试、单元测试 | GitHub Copilot / Cursor / 通义灵码 |
| 数据分析类 | 把表格/数据变成结论和图表 | 报表、销售预测、运营分析 | ChatGPT 数据分析 / Power BI Copilot |
| 办公效率类 | 嵌入 Word/Excel/PPT 里帮你干活 | 写文档、做幻灯片、整理邮件 | WPS AI / M365 Copilot / 飞书 AI |
| 研究学习类 | 带引用地查资料、把文献变知识库 | 论文综述、备考、深度阅读 | Perplexity / NotebookLM / 元宝深度阅读 |
| 智能体与自动化类 | 能自己规划、调工具、跑流程的“机器人” | 客服 Bot、自动工作流 | Coze(扣子) / Dify / n8n |
小提示:很多现代工具是“多面手”。比如豆包既能对话也能生图;Gemini 同时能处理文本、图像、音频、视频。所以分类是帮你“快速定位”,不是死框框。
3.2 按应用场景分类(你“要干什么”)
光看能力还不够,更实用的是从你当下的任务出发。同一类能力,落到不同场景,选的工具可能不同。大纲把场景分为八大类:
- 创作:写文章、写脚本、画插画、做视频。对应文本类 + 图像类 + 视频类。
- 办公:写周报、做 PPT、整理会议纪要。对应办公效率类 + 文本类。
- 学习:备考、读论文、解难题。对应研究学习类 + 文本类。
- 开发:写功能、修 Bug、重构代码库。对应编程辅助类 + 文本类。
- 营销:做海报、剪广告、写卖点文案。对应图像类 + 视频类 + 文本类。
- 企业:数据看板、内部知识库、流程自动化。对应数据分析类 + 办公类 + 智能体类。
- 服务:智能客服、问答助手。对应智能体与自动化类 + 文本类。
- 自动化:把多个步骤串成无人值守的流程。对应智能体与自动化类。
关键思路:场景往往是“跨类别组合”的。例如“做一条带货短视频”= 文本类写脚本 + 图像类出图 + 视频类/剪辑类成片。这正是后面 3.3 要讲的“组合使用”。
3.3 工具选择决策框架(五步决策框架)
知道了分类,真正落地时请套用下面这套五步决策框架。这是本章的灵魂,请记住顺序:
明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用
下面是五步决策框架的完整流程图,每一步都标注了输入、输出和判断分支,方便你对照使用:
如何结合 3.1 和 3.2 的分类表使用这套流程?
- 第 2 步「选类别」是连接点:先看 3.1 的能力形态表,根据产出物形态锁定能力类别(如“要一张图”→图像生成类);再看 3.2 的应用场景表,确认当前任务属于哪个场景(如“电商促销”→营销场景),从而得到“能力类别 + 场景组合”的双重定位。
- 第 3 步「筛工具」用 3.4 速览表收窄:在已锁定的类别里,用 3.4 的“国际与国内速览表”和你的限制条件(中文、合规、预算)把候选缩小到 2~3 款。
- 第 5 步「组合使用」体现跨类别:3.2 强调“场景往往是跨类别组合”,例如做带货短视频 = 文本类写脚本 + 图像类出图 + 视频类成片,正好对应流程最后一步把多个环节的工具串成工作流。
第 1 步:明确需求(先问清楚自己要什么)
别一上来就问“哪个 AI 最好”。先写下:我要解决的具体问题是什么?产出物是文字、图、还是视频?有没有限制(比如数据不能出公司、必须中文、要免费)?需求越具体,后面越准。
第 2 步:选类别(对到 3.1 / 3.2 的框架上)
根据产出物形态,落到能力类别(如“要一张图”→图像生成类);再根据使用场景,确认场景组合(如“电商促销”→营销场景)。
第 3 步:筛工具(在类别里挑候选)
同一类别里有国际和国内、免费和付费、通用和专精之分。用“国际与国内速览表”(3.4)和你的限制条件(中文、合规、预算)缩小到 2~3 款。
第 4 步:试用对比(小成本真用一次)
别只看测评。注册/打开,用你真实的需求跑一遍,对比:出结果质量、上手难度、速度、价格、稳定性。试用是避免“踩坑”的最便宜方式。
第 5 步:组合使用(搭自己的工作流)
单一工具往往不够。把擅长不同环节的工具串起来,形成你的固定流程(例如:豆包写文案 → 即梦出海报 → 剪映成片)。组合后的效率远超单打独斗。
附:国际工具与国内工具的取舍维度
- 访问便捷性:国内工具免合规网络、稳定性高;国际工具可能需要特殊网络环境。
- 中文优化:国内模型(豆包、文心一言、通义千问)在中文语境、古文、本地化表达上更顺。
- 合规与数据驻留:公司敏感数据、涉密信息、不能出境的数据,必须优先选可私有化 / 国内合规方案(如 DeepSeek、通义千问私有化、M365 租户内)。
3.4 国际与国内工具速览(2026)
下面这张表来自大纲,完整纳入正文。它把每一类能力的“国际主流”和“国内主流”摆在一起,方便你一眼对照。
| 类别 | 国际主流 | 国内主流 |
|---|---|---|
| 通用对话 | ChatGPT / Claude / Gemini | 豆包 / DeepSeek / Kimi / 文心一言 / 通义千问 / 元宝 |
| 图像生成 | Midjourney / FLUX / Imagen | 即梦 / 通义万相 / 豆包图像 |
| 视频生成 | Sora / Veo 3 | 可灵 / 即梦视频 |
| 编程辅助 | GitHub Copilot / Cursor / Claude Code | 通义灵码 / 豆包编程 |
| 研究学习 | Perplexity / NotebookLM / Elicit | 知网 AI / 元宝深度阅读 |
什么时候选国际工具?
- 你需要最强通用能力、多模态(看图听声)、超长上下文(如 Gemini 2M)。
- 你的内容不涉及敏感数据,且能稳定访问。
- 你做国际化业务、需要英文语料或更广的海外生态。
什么时候选国内工具?
- 你主要处理中文、要本地化表达、要免费/低门槛快速上手。
- 公司有数据出境限制、合规要求、或需私有化部署(DeepSeek、通义千问、文心一言都支持)。
- 你希望稳定访问、客服在国内、付款方便。
3.5 操作示例
下面用两个完整走查,演示如何把“五步决策框架”真正用起来。每个示例都给出输入(场景)和预期输出(推导过程 + 结论)。
3.5.1 示例 1:「按需求选工具」走查——淘宝店促销海报
【输入】
场景:我想给淘宝店做一张“双 11 促销海报”,要突出折扣信息,最好今天就能出图,我是新手、不会用 PS。
【推导过程】
- 明确需求:产出物 = 一张图(海报);场景 = 电商营销;限制 = 新手、零设计基础、要快、大概率中文环境、淘宝店铺数据不敏感但图要能商用。
- 选类别:产出物是“图” → 落到图像生成类(3.1 节);场景是“营销/电商” → 对应 3.2 节的营销场景。
- 筛工具:图像生成类候选有 Midjourney(国际,审美强但需订阅、文本排版弱、中文提示词需中英混合)、FLUX(开源、需部署门槛)、即梦 / 通义万相 / 豆包图像(国内、中文友好、零门槛、电商模板、可商用友好)。
- 试用对比(基于限制推断):用户是新手、要快、要中文、不会 PS → 国际与国内工具中,Midjourney 的 Discord 操作和排版弱点不友好;国内即梦有“电商主图/海报”模板,中文直接描述即可,免费且出图快。
- 组合使用(可选):先用豆包 / 文心一言写一句吸引人的促销文案 → 再丢进 即梦 生成海报底图 → 用 剪映/美图秀秀 微调排版。
【预期输出:最终工具建议表】
| 步骤 | 环节 | 推荐工具 | 理由 |
|---|---|---|---|
| 1 | 写海报文案 | 豆包 / 文心一言 | 中文创意强、免费、出 slogan 快 |
| 2 | 生成海报图 | 即梦(首选)/ 通义万相 | 中文提示词友好、电商模板、零门槛、可商用 |
| 3(备选) | 追求极致审美 | Midjourney | 仅当你愿意学 Discord、接受订阅、且不需精准中文排版时 |
| 4 | 排版微调 | 剪映 / 美图秀秀 | 加文字、抠图、导出方便 |
结论:本场景下首选「图像生成类 → 即梦(国内)」,新手今天就能出图;Midjourney 作为审美升级的备选,非必需。
3.5.2 示例 2:「国际与国内取舍」走查——公司数据不能出境外
【输入】
场景:我们是一家金融企业,需要用 AI 分析内部客户数据和合同,但监管要求数据不能出境,也不能用会把数据传到境外的公有云服务。怎么选?
【推导过程】
- 明确需求:任务 = 数据分析 + 文档/合同审阅;硬限制 =数据不出境外、合规、可审计。
- 选类别:数据分析类(3.1 节)+ 文本/办公类;场景 = 企业(3.2 节)。
- 筛工具(套用 3.4 速览表 + 取舍维度):
- 国际通用对话(ChatGPT / Claude / Gemini)和 SaaS 版 Copilot 默认数据可能出境,触碰合规红线,排除。
- 国内可私有化部署的模型是重点候选:DeepSeek(开源、支持私有化、代码数学强)、通义千问(企业市占第一、多模态、可开源本地部署)、文心一言(政企金融私有化成熟、合规强)。
- 编程/内部工具可用通义灵码(国内、中文好);办公可用 WPS AI(国内套件)。
- 试用对比:在隔离的内网环境部署 DeepSeek 私有化版做合同初审 + 通义千问私有化做数据分析,验证精度与响应;确认数据全程不出域、有权限审计。
- 组合使用:通义千问(私有化)做数据报表 + DeepSeek(私有化)做合同风险抽取 + WPS AI 出内部文档;全程跑在内网。
【预期输出:国际与国内对比表】
| 维度 | 国际工具(ChatGPT / Claude / Gemini 公有云) | 国内合规工具(DeepSeek / 通义千问 私有化) |
|---|---|---|
| 数据是否出境 | 可能出境,违反监管要求 | 全程不出域,满足合规 |
| 部署方式 | 公有云 SaaS | 支持私有化/本地部署 |
| 中文与合规 | 中文较弱、合规认证不一 | 中文优化、政企合规成熟 |
| 成本 | 订阅/API 外币结算 | 开源可自建、可控 |
| 适用结论 | 禁用(本场景) | 选用(本场景首选) |
结论:在数据不能出境的金融场景下,必须选国内可私有化工具(如 DeepSeek / 通义千问私有化部署),国际公有云方案直接排除。
3.6 小结回顾
本章要点
- AI 工具可从三个维度看:能力形态(能做什么)、应用场景(要干什么)、决策框架(怎么选)。
- 十大能力形态:文本/对话、图像生成、图像识别(CV)、视频、语音、编程辅助、数据分析、办公效率、研究学习、智能体与自动化。
- 八大应用场景:创作、办公、学习、开发、营销、企业、服务、自动化——且多数任务是跨类别组合。
- 五步决策框架务必记牢:明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用。
- 国际与国内:看访问便捷性、中文优化、合规与数据驻留;敏感数据/合规场景优先国内可私有化方案。
自测题(合上书写答案,再回看核对)
- 我想“把一段会议录音变成文字纪要”,应该先映射到哪个能力类别?最终可能用到哪类工具?
- 说出五步决策框架的五步,并解释为什么“试用对比”不能省。
- 公司合同含商业机密、禁止出境,图像生成类该选 Midjourney 还是即梦/通义万相?为什么?
- 在 3.4 节速览表里,“视频生成”的国际与国内主流分别是什么?
- 举例说明一个“跨类别组合”的真实任务,并写出你的工具组合。
自测答案速查
- 语音类(ASR 语音转文字)+ 文本/办公类;如讯飞听见转写 + 豆包 / ChatGPT 出纪要。
- 明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用;因为测评 ≠ 真实体验,试用能用最小成本避开质量 / 门槛 / 价格坑。
- 选国内即梦 / 通义万相(或私有化部署),因数据出境合规限制,国际 SaaS 有风险。
- 国际与国内:Sora / Veo 3;国内:可灵 / 即梦视频。
- 例:做带货短视频 = 豆包写脚本 + 即梦出图 + 剪映成片(文本 + 图像 + 视频三类组合)。
第 1 题解析:会议录音是“声音”形态,所以第一步先映射到语音类(ASR 语音转文字),把音频变成可编辑的文字稿;但转写出的只是原始文本,还需要文本/办公类工具来整理、提炼成结构化纪要。具体操作:先用讯飞听见上传录音并转写,得到带时间戳的逐字稿;再把逐字稿粘贴到豆包,输入“请把这段会议内容整理成纪要,包含议题、结论和待办事项”,豆包即可自动归纳成条理清晰的纪要。
第 5 题解析:以“做带货短视频”为例,三个环节环环相扣。豆包写脚本:输入“为某款保温杯写 30 秒带货脚本”,输出含开场钩子、卖点、行动号召的文案;即梦出图:把脚本中的关键画面描述(如“手持保温杯的年轻人在办公室”)作为提示词,生成分镜底图;剪映成片:将脚本配音、底图、字幕和背景音乐导入剪映,按时间轴拼接导出成片。前一步的输出正是后一步的输入,形成“文本 → 图像 → 视频”的完整工作流。
3.7 参考资料与延伸阅读
为方便你进一步深入,这里按「官方文档、对比评测、合规参考」三组整理本章涉及的核心资料。每条都附一句说明,帮你判断什么时候值得点开。
一、官方文档(按能力类别分组)
通用对话 / 文本类
- OpenAI 官方文档:ChatGPT 与 GPT 系列 API 的权威说明,适合想调用接口或了解模型能力边界的读者。
- Anthropic 官方文档:Claude 系列的使用指南与提示词最佳实践,做长文本、代码任务时可对照查阅。
- Google Gemini 官方文档:Gemini 多模态能力与 API 参考,想体验超长上下文(2M)可从这里入手。
- DeepSeek 官方文档:DeepSeek 的模型说明与 API 文档,开源可私有化部署,适合关注数据合规的开发者。
- 豆包(火山方舟)官方文档:豆包模型与火山引擎平台的接入文档,国内开发者上手中文对话类应用的首选参考。
- Kimi(月之暗面)官方文档:Kimi 长文本能力与 API 文档,处理超长文档、深度阅读时可参考。
- 腾讯元宝官方文档:元宝的深度阅读与联网搜索能力说明,做研究学习类任务时可对照。
图像生成类
- Midjourney 官方文档:提示词写法、参数与版本说明,想提升出图审美和排版控制力必读。
- 即梦(Jimeng)官方文档:即梦的图生图、视频生成与电商模板说明,国内零门槛出图首选。
- 通义万相官方文档:通义万相图像生成 API 与模型说明,适合需要批量生成或接入业务系统的场景。
视频生成类
- Sora 官方文档:OpenAI 文生视频模型的官方介绍与能力说明,关注视频生成前沿可收藏。
- 可灵(Kling)官方文档:快手可灵的视频生成与图生视频说明,国内做短视频素材可参考。
语音类
- 讯飞听见官方文档:会议录音转写、字幕生成等语音服务的官方入口,做会议纪要、字幕时直接使用。
办公效率类
- WPS AI 官方文档:WPS AI 在文档、表格、演示中的功能说明,日常办公提效可对照使用。
- Microsoft 365 Copilot 官方文档:M365 Copilot 在 Word/Excel/PPT 中的集成说明,企业办公场景可参考。
智能体与自动化类
- Coze(扣子)官方文档:扣子搭建 Bot 与工作流的可视化教程,零代码做智能体可从这里起步。
- Dify 官方文档:Dify 开源 LLM 应用开发平台的文档,适合想自建知识库或 Agent 的开发者。
- n8n 官方文档:n8n 自动化工作流平台的节点与触发说明,做跨工具流程编排时可查阅。
二、对比评测(国际与国内)
- 机器之心:2026 年国内外大模型能力对比评测:机器之心定期发布主流大模型在中文理解、代码、多模态等维度的横向评测,帮你用数据判断「国际与国内」的真实差距,避免只看宣传。
- 量子位:国产大模型与 GPT 系列实测报告:量子位常做中文语境下的实测对比,覆盖豆包、DeepSeek、通义千问等,对本章 3.4 节「什么时候选国内工具」是很好的补充证据。
- InfoQ:AI 工具选型与落地实践专题:InfoQ 偏工程与落地视角,常有企业级 AI 工具选型、私有化部署的案例复盘,适合做 3.5 节「金融数据不出境」这类场景的延伸阅读。
三、合规参考(数据出境与生成式 AI 监管)
- 《生成式人工智能服务管理暂行办法》(国家网信办):中国生成式 AI 服务的基础监管文件,明确服务提供者的备案、内容安全等义务,做国际与国内合规选型前务必通读。
- 《数据出境安全评估办法》(国家网信办):规定数据出境的安全评估流程与触发条件,对应本章 3.5.2「公司数据不能出境外」场景,是判断「哪些数据不能出境」的直接依据。
- 《个人信息保护法》与《数据安全法》官方文本(全国人大网):数据合规的上位法,理解「数据驻留、可审计」等要求的法律源头,适合企业读者建立合规底线认知。
使用建议:官方文档用于「动手前查准」;对比评测用于「选型时看趋势」;合规参考用于「上线前把关」。三者配合,正好呼应本章「明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用」的五步决策框架——先看官方文档明确能力边界,再用评测收窄候选,最后用合规条款做硬性过滤。