news 2026/9/4 11:08:09

人工智能常用工具学习(三)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
人工智能常用工具学习(三)

第 3 章 主流 AI 工具分类全景

摘要:本章帮你建立对 AI 工具的全景认知。先按能力形态(文本 / 图像 / 视频 / 语音 / 编程 / 数据分析等十大类)和应用场景(创作 / 办公 / 学习 / 开发 / 营销 / 企业 / 服务 / 自动化八大类)给工具分类;再掌握五步决策框架(明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用);最后通过国际与国内速览表和两个实战走查(淘宝促销海报、金融数据不出境),学会在具体需求下快速锁定合适的工具组合。

本章目标:帮你建立对 AI 工具的全景认知,做到“看到需求,就能大致判断该用哪一类、哪一款工具”。读完本章,你不再会在成百上千款工具里迷路。


3.0 学习目标学完本章,你应该能够:

  1. 按能力形态识别工具:看到“文本 / 图像 / 视频 / 语音 / 编程 / 数据分析”等类别时,能说出这类工具是干什么的、有哪些代表产品。
  2. 按应用场景归类需求:把“写文案、做海报、剪视频、写代码、开周会”等日常任务,映射到对应的工具场景。
  3. 套用决策框架做选择:掌握“明确需求 → 选类别 → 筛工具 → 试用 → 组合”的五步决策框架,不再凭感觉乱试。
  4. 判断国际 vs 国内取舍:知道什么时候优先用国内合规工具,什么时候国际工具更合适。

面对市面上成百上千款 AI 工具,零基础用户最大的困惑往往是:“到底该选哪个?”答案的第一步,是先给工具“分个类”。本章从三个维度帮你搭起认知框架:按能力形态分、按应用场景分、按决策框架选,最后再补一个实用的“国际与国内速览表”。

3.1 按能力形态分类(工具“能做什么”)

这是最直观的分类方式——看工具处理的是哪种信息形态。大纲把能力形态分为十大类,我们逐一通俗说明:

类别一句话解释典型用途代表工具
文本/对话类你打字、它说话,像聊天一样帮你写和想写文案、答疑、翻译、头脑风暴ChatGPT / 豆包 / DeepSeek / Kimi
图像生成类你描述一句话,它画出一张图海报、插画、头像、概念图Midjourney / 即梦 / 通义万相
图像识别类(CV)“看懂”图片里的内容文字识别(OCR)、人脸检测、瑕疵筛查百度智能云视觉 / Google Vision
视频类文生视频、图生视频、AI 剪辑短视频、广告片、教学片Sora / 可灵 / 剪映
语音类听(语音转文字)和说(文字转语音)会议转写、配音、有声书讯飞听见 / Whisper / ElevenLabs
编程辅助类帮你写代码、改 Bug、理解项目开发、调试、单元测试GitHub Copilot / Cursor / 通义灵码
数据分析类把表格/数据变成结论和图表报表、销售预测、运营分析ChatGPT 数据分析 / Power BI Copilot
办公效率类嵌入 Word/Excel/PPT 里帮你干活写文档、做幻灯片、整理邮件WPS AI / M365 Copilot / 飞书 AI
研究学习类带引用地查资料、把文献变知识库论文综述、备考、深度阅读Perplexity / NotebookLM / 元宝深度阅读
智能体与自动化类能自己规划、调工具、跑流程的“机器人”客服 Bot、自动工作流Coze(扣子) / Dify / n8n

小提示:很多现代工具是“多面手”。比如豆包既能对话也能生图;Gemini 同时能处理文本、图像、音频、视频。所以分类是帮你“快速定位”,不是死框框。

3.2 按应用场景分类(你“要干什么”)

光看能力还不够,更实用的是从你当下的任务出发。同一类能力,落到不同场景,选的工具可能不同。大纲把场景分为八大类:

  • 创作:写文章、写脚本、画插画、做视频。对应文本类 + 图像类 + 视频类。
  • 办公:写周报、做 PPT、整理会议纪要。对应办公效率类 + 文本类。
  • 学习:备考、读论文、解难题。对应研究学习类 + 文本类。
  • 开发:写功能、修 Bug、重构代码库。对应编程辅助类 + 文本类。
  • 营销:做海报、剪广告、写卖点文案。对应图像类 + 视频类 + 文本类。
  • 企业:数据看板、内部知识库、流程自动化。对应数据分析类 + 办公类 + 智能体类。
  • 服务:智能客服、问答助手。对应智能体与自动化类 + 文本类。
  • 自动化:把多个步骤串成无人值守的流程。对应智能体与自动化类。

关键思路:场景往往是“跨类别组合”的。例如“做一条带货短视频”= 文本类写脚本 + 图像类出图 + 视频类/剪辑类成片。这正是后面 3.3 要讲的“组合使用”。

3.3 工具选择决策框架(五步决策框架)

知道了分类,真正落地时请套用下面这套五步决策框架。这是本章的灵魂,请记住顺序:

明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用

下面是五步决策框架的完整流程图,每一步都标注了输入输出判断分支,方便你对照使用:

文字

视频

输入:具体问题 + 产出物形态 + 限制条件

第1步 明确需求

产出物是文字、图、还是视频?

第2步 选类别:文本/对话类

第2步 选类别:图像生成类

第2步 选类别:视频类

第3步 筛工具:结合 3.4 速览表 + 限制条件

是否满足中文/合规/预算限制?

第4步 试用对比:真实需求跑一遍

结果质量/上手难度/速度/价格是否达标?

第5步 组合使用:串成固定工作流

输出:最终工具组合方案

如何结合 3.1 和 3.2 的分类表使用这套流程?

  • 第 2 步「选类别」是连接点:先看 3.1 的能力形态表,根据产出物形态锁定能力类别(如“要一张图”→图像生成类);再看 3.2 的应用场景表,确认当前任务属于哪个场景(如“电商促销”→营销场景),从而得到“能力类别 + 场景组合”的双重定位。
  • 第 3 步「筛工具」用 3.4 速览表收窄:在已锁定的类别里,用 3.4 的“国际与国内速览表”和你的限制条件(中文、合规、预算)把候选缩小到 2~3 款。
  • 第 5 步「组合使用」体现跨类别:3.2 强调“场景往往是跨类别组合”,例如做带货短视频 = 文本类写脚本 + 图像类出图 + 视频类成片,正好对应流程最后一步把多个环节的工具串成工作流。

第 1 步:明确需求(先问清楚自己要什么)
别一上来就问“哪个 AI 最好”。先写下:我要解决的具体问题是什么?产出物是文字、图、还是视频?有没有限制(比如数据不能出公司、必须中文、要免费)?需求越具体,后面越准。

第 2 步:选类别(对到 3.1 / 3.2 的框架上)
根据产出物形态,落到能力类别(如“要一张图”→图像生成类);再根据使用场景,确认场景组合(如“电商促销”→营销场景)。

第 3 步:筛工具(在类别里挑候选)
同一类别里有国际和国内、免费和付费、通用和专精之分。用“国际与国内速览表”(3.4)和你的限制条件(中文、合规、预算)缩小到 2~3 款。

第 4 步:试用对比(小成本真用一次)
别只看测评。注册/打开,用你真实的需求跑一遍,对比:出结果质量、上手难度、速度、价格、稳定性。试用是避免“踩坑”的最便宜方式。

第 5 步:组合使用(搭自己的工作流)
单一工具往往不够。把擅长不同环节的工具串起来,形成你的固定流程(例如:豆包写文案 → 即梦出海报 → 剪映成片)。组合后的效率远超单打独斗。

附:国际工具与国内工具的取舍维度

  • 访问便捷性:国内工具免合规网络、稳定性高;国际工具可能需要特殊网络环境。
  • 中文优化:国内模型(豆包、文心一言、通义千问)在中文语境、古文、本地化表达上更顺。
  • 合规与数据驻留:公司敏感数据、涉密信息、不能出境的数据,必须优先选可私有化 / 国内合规方案(如 DeepSeek、通义千问私有化、M365 租户内)。
3.4 国际与国内工具速览(2026)

下面这张表来自大纲,完整纳入正文。它把每一类能力的“国际主流”和“国内主流”摆在一起,方便你一眼对照。

类别国际主流国内主流
通用对话ChatGPT / Claude / Gemini豆包 / DeepSeek / Kimi / 文心一言 / 通义千问 / 元宝
图像生成Midjourney / FLUX / Imagen即梦 / 通义万相 / 豆包图像
视频生成Sora / Veo 3可灵 / 即梦视频
编程辅助GitHub Copilot / Cursor / Claude Code通义灵码 / 豆包编程
研究学习Perplexity / NotebookLM / Elicit知网 AI / 元宝深度阅读

什么时候选国际工具?

  • 你需要最强通用能力、多模态(看图听声)、超长上下文(如 Gemini 2M)。
  • 你的内容不涉及敏感数据,且能稳定访问。
  • 你做国际化业务、需要英文语料或更广的海外生态。

什么时候选国内工具?

  • 你主要处理中文、要本地化表达、要免费/低门槛快速上手。
  • 公司有数据出境限制、合规要求、或需私有化部署(DeepSeek、通义千问、文心一言都支持)。
  • 你希望稳定访问、客服在国内、付款方便。

3.5 操作示例

下面用两个完整走查,演示如何把“五步决策框架”真正用起来。每个示例都给出输入(场景)预期输出(推导过程 + 结论)

3.5.1 示例 1:「按需求选工具」走查——淘宝店促销海报

【输入】

场景:我想给淘宝店做一张“双 11 促销海报”,要突出折扣信息,最好今天就能出图,我是新手、不会用 PS。

【推导过程】

  1. 明确需求:产出物 = 一张图(海报);场景 = 电商营销;限制 = 新手、零设计基础、要快、大概率中文环境、淘宝店铺数据不敏感但图要能商用。
  2. 选类别:产出物是“图” → 落到图像生成类(3.1 节);场景是“营销/电商” → 对应 3.2 节的营销场景。
  3. 筛工具:图像生成类候选有 Midjourney(国际,审美强但需订阅、文本排版弱、中文提示词需中英混合)、FLUX(开源、需部署门槛)、即梦 / 通义万相 / 豆包图像(国内、中文友好、零门槛、电商模板、可商用友好)。
  4. 试用对比(基于限制推断):用户是新手、要快、要中文、不会 PS → 国际与国内工具中,Midjourney 的 Discord 操作和排版弱点不友好;国内即梦有“电商主图/海报”模板,中文直接描述即可,免费且出图快。
  5. 组合使用(可选):先用豆包 / 文心一言写一句吸引人的促销文案 → 再丢进 即梦 生成海报底图 → 用 剪映/美图秀秀 微调排版。

【预期输出:最终工具建议表】

步骤环节推荐工具理由
1写海报文案豆包 / 文心一言中文创意强、免费、出 slogan 快
2生成海报图即梦(首选)/ 通义万相中文提示词友好、电商模板、零门槛、可商用
3(备选)追求极致审美Midjourney仅当你愿意学 Discord、接受订阅、且不需精准中文排版时
4排版微调剪映 / 美图秀秀加文字、抠图、导出方便

结论:本场景下首选「图像生成类 → 即梦(国内)」,新手今天就能出图;Midjourney 作为审美升级的备选,非必需。

3.5.2 示例 2:「国际与国内取舍」走查——公司数据不能出境外

【输入】

场景:我们是一家金融企业,需要用 AI 分析内部客户数据和合同,但监管要求数据不能出境,也不能用会把数据传到境外的公有云服务。怎么选?

【推导过程】

  1. 明确需求:任务 = 数据分析 + 文档/合同审阅;硬限制 =数据不出境外、合规、可审计
  2. 选类别:数据分析类(3.1 节)+ 文本/办公类;场景 = 企业(3.2 节)。
  3. 筛工具(套用 3.4 速览表 + 取舍维度)
  • 国际通用对话(ChatGPT / Claude / Gemini)和 SaaS 版 Copilot 默认数据可能出境,触碰合规红线,排除。
  • 国内可私有化部署的模型是重点候选:DeepSeek(开源、支持私有化、代码数学强)、通义千问(企业市占第一、多模态、可开源本地部署)、文心一言(政企金融私有化成熟、合规强)。
  • 编程/内部工具可用通义灵码(国内、中文好);办公可用 WPS AI(国内套件)。
  1. 试用对比:在隔离的内网环境部署 DeepSeek 私有化版做合同初审 + 通义千问私有化做数据分析,验证精度与响应;确认数据全程不出域、有权限审计。
  2. 组合使用:通义千问(私有化)做数据报表 + DeepSeek(私有化)做合同风险抽取 + WPS AI 出内部文档;全程跑在内网。

【预期输出:国际与国内对比表】

维度国际工具(ChatGPT / Claude / Gemini 公有云)国内合规工具(DeepSeek / 通义千问 私有化)
数据是否出境可能出境,违反监管要求全程不出域,满足合规
部署方式公有云 SaaS支持私有化/本地部署
中文与合规中文较弱、合规认证不一中文优化、政企合规成熟
成本订阅/API 外币结算开源可自建、可控
适用结论禁用(本场景)选用(本场景首选)

结论:在数据不能出境的金融场景下,必须选国内可私有化工具(如 DeepSeek / 通义千问私有化部署),国际公有云方案直接排除。


3.6 小结回顾

本章要点
  • AI 工具可从三个维度看:能力形态(能做什么)应用场景(要干什么)决策框架(怎么选)
  • 十大能力形态:文本/对话、图像生成、图像识别(CV)、视频、语音、编程辅助、数据分析、办公效率、研究学习、智能体与自动化。
  • 八大应用场景:创作、办公、学习、开发、营销、企业、服务、自动化——且多数任务是跨类别组合。
  • 五步决策框架务必记牢:明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用
  • 国际与国内:看访问便捷性、中文优化、合规与数据驻留;敏感数据/合规场景优先国内可私有化方案。
自测题(合上书写答案,再回看核对)
  1. 我想“把一段会议录音变成文字纪要”,应该先映射到哪个能力类别?最终可能用到哪类工具?
  2. 说出五步决策框架的五步,并解释为什么“试用对比”不能省。
  3. 公司合同含商业机密、禁止出境,图像生成类该选 Midjourney 还是即梦/通义万相?为什么?
  4. 在 3.4 节速览表里,“视频生成”的国际与国内主流分别是什么?
  5. 举例说明一个“跨类别组合”的真实任务,并写出你的工具组合。
自测答案速查
  1. 语音类(ASR 语音转文字)+ 文本/办公类;如讯飞听见转写 + 豆包 / ChatGPT 出纪要。
  2. 明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用;因为测评 ≠ 真实体验,试用能用最小成本避开质量 / 门槛 / 价格坑。
  3. 选国内即梦 / 通义万相(或私有化部署),因数据出境合规限制,国际 SaaS 有风险。
  4. 国际与国内:Sora / Veo 3;国内:可灵 / 即梦视频。
  5. 例:做带货短视频 = 豆包写脚本 + 即梦出图 + 剪映成片(文本 + 图像 + 视频三类组合)。

第 1 题解析:会议录音是“声音”形态,所以第一步先映射到语音类(ASR 语音转文字),把音频变成可编辑的文字稿;但转写出的只是原始文本,还需要文本/办公类工具来整理、提炼成结构化纪要。具体操作:先用讯飞听见上传录音并转写,得到带时间戳的逐字稿;再把逐字稿粘贴到豆包,输入“请把这段会议内容整理成纪要,包含议题、结论和待办事项”,豆包即可自动归纳成条理清晰的纪要。

第 5 题解析:以“做带货短视频”为例,三个环节环环相扣。豆包写脚本:输入“为某款保温杯写 30 秒带货脚本”,输出含开场钩子、卖点、行动号召的文案;即梦出图:把脚本中的关键画面描述(如“手持保温杯的年轻人在办公室”)作为提示词,生成分镜底图;剪映成片:将脚本配音、底图、字幕和背景音乐导入剪映,按时间轴拼接导出成片。前一步的输出正是后一步的输入,形成“文本 → 图像 → 视频”的完整工作流。


3.7 参考资料与延伸阅读

为方便你进一步深入,这里按「官方文档、对比评测、合规参考」三组整理本章涉及的核心资料。每条都附一句说明,帮你判断什么时候值得点开。

一、官方文档(按能力类别分组)

通用对话 / 文本类

  • OpenAI 官方文档:ChatGPT 与 GPT 系列 API 的权威说明,适合想调用接口或了解模型能力边界的读者。
  • Anthropic 官方文档:Claude 系列的使用指南与提示词最佳实践,做长文本、代码任务时可对照查阅。
  • Google Gemini 官方文档:Gemini 多模态能力与 API 参考,想体验超长上下文(2M)可从这里入手。
  • DeepSeek 官方文档:DeepSeek 的模型说明与 API 文档,开源可私有化部署,适合关注数据合规的开发者。
  • 豆包(火山方舟)官方文档:豆包模型与火山引擎平台的接入文档,国内开发者上手中文对话类应用的首选参考。
  • Kimi(月之暗面)官方文档:Kimi 长文本能力与 API 文档,处理超长文档、深度阅读时可参考。
  • 腾讯元宝官方文档:元宝的深度阅读与联网搜索能力说明,做研究学习类任务时可对照。

图像生成类

  • Midjourney 官方文档:提示词写法、参数与版本说明,想提升出图审美和排版控制力必读。
  • 即梦(Jimeng)官方文档:即梦的图生图、视频生成与电商模板说明,国内零门槛出图首选。
  • 通义万相官方文档:通义万相图像生成 API 与模型说明,适合需要批量生成或接入业务系统的场景。

视频生成类

  • Sora 官方文档:OpenAI 文生视频模型的官方介绍与能力说明,关注视频生成前沿可收藏。
  • 可灵(Kling)官方文档:快手可灵的视频生成与图生视频说明,国内做短视频素材可参考。

语音类

  • 讯飞听见官方文档:会议录音转写、字幕生成等语音服务的官方入口,做会议纪要、字幕时直接使用。

办公效率类

  • WPS AI 官方文档:WPS AI 在文档、表格、演示中的功能说明,日常办公提效可对照使用。
  • Microsoft 365 Copilot 官方文档:M365 Copilot 在 Word/Excel/PPT 中的集成说明,企业办公场景可参考。

智能体与自动化类

  • Coze(扣子)官方文档:扣子搭建 Bot 与工作流的可视化教程,零代码做智能体可从这里起步。
  • Dify 官方文档:Dify 开源 LLM 应用开发平台的文档,适合想自建知识库或 Agent 的开发者。
  • n8n 官方文档:n8n 自动化工作流平台的节点与触发说明,做跨工具流程编排时可查阅。
二、对比评测(国际与国内)
  • 机器之心:2026 年国内外大模型能力对比评测:机器之心定期发布主流大模型在中文理解、代码、多模态等维度的横向评测,帮你用数据判断「国际与国内」的真实差距,避免只看宣传。
  • 量子位:国产大模型与 GPT 系列实测报告:量子位常做中文语境下的实测对比,覆盖豆包、DeepSeek、通义千问等,对本章 3.4 节「什么时候选国内工具」是很好的补充证据。
  • InfoQ:AI 工具选型与落地实践专题:InfoQ 偏工程与落地视角,常有企业级 AI 工具选型、私有化部署的案例复盘,适合做 3.5 节「金融数据不出境」这类场景的延伸阅读。
三、合规参考(数据出境与生成式 AI 监管)
  • 《生成式人工智能服务管理暂行办法》(国家网信办):中国生成式 AI 服务的基础监管文件,明确服务提供者的备案、内容安全等义务,做国际与国内合规选型前务必通读。
  • 《数据出境安全评估办法》(国家网信办):规定数据出境的安全评估流程与触发条件,对应本章 3.5.2「公司数据不能出境外」场景,是判断「哪些数据不能出境」的直接依据。
  • 《个人信息保护法》与《数据安全法》官方文本(全国人大网):数据合规的上位法,理解「数据驻留、可审计」等要求的法律源头,适合企业读者建立合规底线认知。

使用建议:官方文档用于「动手前查准」;对比评测用于「选型时看趋势」;合规参考用于「上线前把关」。三者配合,正好呼应本章「明确需求 → 选类别 → 筛工具 → 试用对比 → 组合使用」的五步决策框架——先看官方文档明确能力边界,再用评测收窄候选,最后用合规条款做硬性过滤。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 11:06:54

家用无线吸尘器选购全攻略:从核心参数到场景匹配

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:05:55

ONNX Runtime Windows ZIP包深度解析与部署实践

简介:本资源是ONNX Runtime 1.23.1版本的Windows x64官方预编译CPU运行时安装包,专为AI模型部署开发者、边缘推理工程师及深度学习实践者提供开箱即用的本地推理支持。压缩包共26个文件,包含14个头文件(如onnxruntime_c_api.h、on…

作者头像 李华
网站建设 2026/9/4 11:05:20

15分钟用Czkawka扫出磁盘里的重复文件

15分钟用Czkawka扫出磁盘里的重复文件 【免费下载链接】czkawka Multi functional app to find duplicates, empty folders, similar images etc. 项目地址: https://gitcode.com/GitHub_Trending/cz/czkawka 磁盘空间告急时,你打开文件管理器翻了一下午&…

作者头像 李华
网站建设 2026/9/4 11:05:11

WezTerm:GPU加速跨平台终端模拟器快速上手指南

WezTerm:GPU加速跨平台终端模拟器快速上手指南 【免费下载链接】wezterm A GPU-accelerated cross-platform terminal emulator and multiplexer written by wez and implemented in Rust 项目地址: https://gitcode.com/GitHub_Trending/we/wezterm 终端字体…

作者头像 李华
网站建设 2026/9/4 11:04:33

32位MCU小型化封装深度解析:从QFN到WLCSP的设计实战

开头最近行业里聊得最多的一个话题,就是32位MCU怎么越做越小。以前说到32位单片机,脑子里第一反应还是LQFP64、LQFP100这类“长条螃蟹”式的封装,少说也有10mm见方,巴掌大的PCB上放一颗主控,周围再堆一圈电阻电容&…

作者头像 李华