在早些年,AI大多是“单科生”:翻译模型只处理文字,语音模型只处理声音,图像模型只看懂图片,各个系统互相独立,井水不犯河水。
而现在我们使用的大模型,可以做到:上传一张图片让它解读内容;丢一段录音,自动转写并且分析录音观点;输入文字直接生成图片、短视频。这就是多模态AI。
很多人只知道多模态很好用,但并不明白背后到底发生了什么。本篇继续保持大白话,不讲复杂算法,讲清多模态的底层逻辑、能力边界,以及普通人日常可以拿来干什么,同时分清哪些是真多模态,哪些只是工具简单拼接。
01、什么是模态?什么是多模态AI
模态人话解释:信息的载体形式。
文本模态:文字、对话、文档;
图像模态:照片、截图、手绘、图表;
音频模态:人声录音、对话、音效;
视频模态:由大量图片帧+音频组合而成。
单模态AI:只能接收、输出其中一种信息。早期聊天模型只能读文字;老的识图工具只能看图,不能用自然语言回答你的问题。
多模态AI:可以同时接收、理解、输出多种不同载体的信息,并且实现互相转换。
简单说:既能读字、又能看图、能听声音,还可以文字转图片、图片转文字、语音转文案,不同媒介之间互通。
02、大白话理解多模态底层逻辑
不同媒介完全不一样:图片是像素点阵,声音是声波波形,文字是符号。计算机不能直接把图片、音频直接喂给原本的文本大模型。
多模态模型里面有一套翻译转换器。
打个比方:有一个懂多国语言的翻译官。文字、图片、语音相当于不同国家的语言。
图片、音频进来之后,先经过转换器,全部翻译成模型内部统一的“中间通用语言”,再送入大模型主干网络进行理解、推理;
当需要输出图片或者语音的时候,再把模型内部的通用信息反向翻译,输出成图片、声音。
关键点区分两个概念:
真正的多模态大模型:图片、文字、音频信息进入同一个模型内部做融合理解。比如你上传一张表格截图,提问“帮我算一下表格里面的总和”,它看懂图片里表格,直接做计算。图像、文字信息是真正融合在一起思考。
工具拼接(伪多模态):只是把多个独立小工具硬拼在一起。先调用OCR识别图片得到文字,再把文字丢给文本大模型。图片本身没有进入模型思考,只是转成文字。一旦图片文字模糊、表格复杂,就很容易出错。
03、多模态常见四大能力,结合普通人实操场景
①图文理解:看图说话,解析截图、图表、照片
输入图片,输出文字分析。
实操场景:解读截图里的报错代码;分析试卷照片解题;解读图表数据;看懂手写笔记;分析产品实拍图找问题。
小提示:图片越清晰,效果越好;手写潦草、光线昏暗,识别理解能力会大幅下降。
②文生图、图生图:文字描述生成图像,基于原图修改画面
输入一段文字描述,生成插画、封面、草图;上传一张参考图,按照参考图风格再生成新图。
实操场景:自媒体封面、PPT配图、概念草图、故事插画。
注意:多模态模型画图,不代表可以直接商用,一定要看平台版权协议。人物手部、细节经常会出现崩坏,需要反复迭代调整提示词。
③音频模态:语音转文字、听录音做分析
上传录音,不仅转写文字,还可以直接分析录音内容:提炼会议要点、分析说话人情绪、梳理对话矛盾点。
实操场景:会议录音整理、访谈录音复盘、网课音频梳理笔记。
局限:多人混杂说话、环境噪音很大的时候,识别和理解效果会下滑。
④视频理解:看懂视频内容,文字生成短视频片段
视频本质是一连串图片加上声音。多模态AI可以读取视频片段,总结视频讲了什么;也可以输入文字,生成短视频片段。
实操场景:短视频脚本转预览素材;解析课程视频片段提取要点。
现实短板:目前完整长视频理解成本高;AI直接生成高质量完整长视频依旧不成熟,更多用来生成片段素材。
04、多模态AI的短板,不要过度神话
对细节识别不稳定:图片里细小文字、复杂表格、密密麻麻的数字,很容易看错、读错,涉及数据一定要二次核对;
图像生成经常逻辑错乱:人物肢体、物体透视、数量经常出错,AI画画适合做草图、灵感素材,不能直接当完美成品;
长视频、长音频消耗资源高,很多平台会限制时长,太长的音视频需要分段处理;
依旧会产生幻觉:哪怕是看图回答,也会脑补图片不存在的信息,不能无条件相信输出。
05、普通人使用多模态的几条实操建议
上传图片尽量保证清晰,文字截图避免反光模糊;
遇到图表、数字截图,AI给出结果之后,尽量自己核对一遍数字;
AI生成图片、视频优先当作灵感素材、草稿,人工后期修改再使用;
噪音大的录音,尽量先做降噪,再交给AI分析;
分清真多模态和简单工具拼接,复杂图表、手写内容,优先选用原生多模态大模型。
全篇人话总结
1、模态就是信息载体:文字、图片、音频、视频;多模态AI可以同时理解、转换多种载体信息。
底层原理:图片、音频会被转换成模型内部统一表征,再送入大模型进行推理;输出时再反向转换成对应媒介。
区分真正多模态和工具简单拼接,拼接模式在复杂场景容易翻车。
四大常用能力:图文解析、文生图、音频理解、视频处理;各有对应的现实局限。
多模态输出同样存在幻觉,图片、音频分析结果,关键信息务必人工复核。
下一篇预告:AI幻觉是什么?为什么AI会胡说八道?普通人如何规避、精准校验内容