文章总结与翻译
一、文章主要内容
本文聚焦多模态大型语言模型(MLLMs)中的“文本主导”问题,即模型在推理过程中过度依赖文本信息,而未充分利用图像、视频、音频、时间序列和图等其他模态信息。
1. 研究背景与问题提出
现有MLLMs虽在多模态任务中表现出色,但存在模态失衡问题,此前研究多聚焦于视觉-语言任务,将其归因于数据偏差或模型架构,却忽视了Transformer核心的注意力机制在多模态(如音频、时间序列、图)中的作用,因此需验证文本主导是否为MLLMs的根本性缺陷。
2. 研究方法与评估指标
- 评估框架:选取5种模态(图像、视频、音频、时间序列、图)的代表性数据集(如图像模态的MMMU-Pro、视频模态的MMBench-Video)和主流模型(如Qwen2.5-VL-7B、VideoLLaMA3-7B)展开实验。
- 核心指标:提出两个量化指标以衡量模态失衡:
- 模态主导指数(MDI):计算文本与非文本模态的平均每token注意力占比之比,MDI>1表示文本主导,接近1则模态平衡。
- 注意力效率指数(AEI):通过文本模态的注意力占比与token占比之比,衡量模态将token表示转化为注意力的效率,AEI>1表示该模态注意力效率高。