news 2026/7/29 15:45:09

学习日记44:Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
学习日记44:Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

摘要:

视觉语言模型能再以视觉为中心的任务中很好的整合视觉和文本信息,但是对于模态间信息不一致的处理很不充分;作者通过实验发现当文本和视觉信息出现不一致时,VLMs盲目地相信文本数据而不信任视觉数据,导致在损坏的文本下显著的性能下降。分析了影响这个种文本偏向的因素,由此使用了增强文本的监督微调,并证明其在减少文本偏置的作用。

介绍:

作者探索了指令提示词,语言模型的大小,文本相关性,图像和文本token的顺序以及单模态对于当前任务的确定性对于这种盲目相信文本的情况的影响。

为了探索多模态模型对于文本信息的偏好,文章中设置了3种图文对,即Match(图片和文本信息完全一致),Corruption(图片和文本信息相关,但文本被歪曲,对图片的描述错误),Irrelevance(图片与文本完全无关,各说各的);分别评估相关信息的使用,误导信息的处理,模型忽略分心物的能力。

为了更好评估模型对于各个模态的依赖程度和模型的能力,作者设置了更多指标:

Text Preference Ratio (TPR)衡量当文本和视觉信息不一致时,模型选择文本的可能性来表示文本偏见:

Accuracy任意一组测试集 Q 的标准答题正确率:

Macro Accuracy是使用三种不同图文对的模型上的准确率的平均:

Normalized Accuracy衡量了模型受文本变化影响的程度,相对于基准准确率,即其在基准问题集B上的准确率。对于文本变化下的任意问题集Q计算相应的归一化准确率为(可以理解为相对于基准数据集上的准确率来说这个数据集上的准确率):

实验:

实验设置

这部分其实主要是测试现象,实际上的解决方法十分简单。

在四个不同领域的视觉问答 (VQA) 数据集上测试模型效果,分别是通用视觉问答,文档图文问答,视觉数学推理,网页品牌识别 / 钓鱼检测。作者实验GPT4o对正常文本对的文本部分进行处理得到三种文本对。

在提示词上,作者提醒模型注意潜在的错误,并鼓励谨慎使用文本信息。

并对当前数据进行测试,关掉图像输入,只把Match / Corruption / Irrelevance三类文本单独喂给模型答题,统计纯文本下的准确率,这部是检测文字本身单独存在时,能独立给出确定正确 / 错误答案; 如果不做,就无法区分:模型答错是「被错误文字误导」,还是「文字本身描述不清」,实验结论会失去说服力。

对文本的盲从

可以看到,在Match / Corruption / 中TPR的值都十分大,无论文本是否正确,模型都显示出来对文本信息的极大服从,只有在Irrelevanc情况下,文本显然与图片无关,模型才会对图像更细致的观察。

Base:只输入图片 + 问题不加任何额外文本时,模型答对题目的百分比。

Corruption:同时输入:图片 + 矛盾错误文本(Corrupted Text)+ 问题,模型答对的百分比。

强烈的文本偏好使得Corruption情况下的模型表现显著下降。

影响因素

指令语可以减少文本偏误,但具有局限性。

使用较大的语言模型进行训练可以减少文本偏差,但会出现饱和现象。

相关文本更可能影响视觉-语言模型(文本和问题越相关,模型越愿意相信这段文字,哪怕文字和画面矛盾)。

文本放在前面会大幅加剧文本偏置,TPR 显著升高。

模型会自动对比自己对图像、文字的自信程度,哪边把握大就采信哪边;只要文字侧模型很确定,哪怕图完全相反,也会放弃视觉信息。

解决方法

使用监督微调:具体来说,同时使用纯文本样本图文配对样本两类数据。 一共收集 1000 条微调样本,平均均匀分配到 5 种数据类型中:纯文本数据、原始标准 VQA 样本、附加匹配文本的 VQA 样本、附加污染(错误)文本的 VQA 样本、附加无关文本的 VQA 样本(以上后三类统称为文本增广样本)。

去掉纯文本数据微调:模型 TPR 大幅下降,但会过度排斥正常文本; 保留纯文本数据:模型能清晰区分匹配 / 污染文本,两者 TPR 差距最高 40%,既能采信正确文字、又抵抗错误文字,效果最优。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/29 15:44:03

AI病历质控系统上线倒计时:卫健委新规生效前必须完成的3项合规改造(含GDPR/《个人信息保护法》双适配清单)

更多请点击: https://codechina.net 第一章:AI病历质控系统合规落地的底层逻辑 AI病历质控系统的合规落地,本质是技术能力与医疗法规、临床流程、数据治理三重约束的动态对齐过程。脱离《电子病历系统功能应用水平分级评价标准》《个人信息保…

作者头像 李华
网站建设 2026/7/29 15:39:19

BetterNCM安装器:3分钟搞定网易云插件管理的终极解决方案

BetterNCM安装器:3分钟搞定网易云插件管理的终极解决方案 【免费下载链接】BetterNCM-Installer 一键安装 Better 系软件 项目地址: https://gitcode.com/gh_mirrors/be/BetterNCM-Installer 还在为网易云音乐插件安装的复杂步骤而烦恼吗?BetterN…

作者头像 李华
网站建设 2026/7/29 15:38:54

如何高效使用Bodymovin插件:3个核心场景与深度技术解析

如何高效使用Bodymovin插件:3个核心场景与深度技术解析 【免费下载链接】bodymovin-extension Bodymovin UI extension panel 项目地址: https://gitcode.com/gh_mirrors/bod/bodymovin-extension Bodymovin作为After Effects的专业扩展插件,解决…

作者头像 李华