文章主要内容总结
本文聚焦于单体多模态大语言模型(MLLMs),这类模型将视觉编码与语言解码整合到单一模型中,旨在解决现有单体MLLMs在优化稳定性和灾难性遗忘方面的挑战。
- 核心问题:现有单体MLLMs的预训练策略常面临优化不稳定和灾难性遗忘(即学习视觉知识时丢失原有语言能力),且训练成本高、推理效率低。
- 解决方案:
- 提出Mono-InternVL:通过混合专家(MoE)架构嵌入视觉专家网络,并设计内源性视觉预训练(EViP)策略,分三阶段(概念学习、语义学习、对齐学习)渐进式学习视觉知识,同时冻结LLM参数以保留语言能力。
- 提出Mono-InternVL-1.5:在Mono-InternVL基础上优化,通过EViP++(增加视觉注意力专家、重组高质量训练数据)降低训练成本,同时引入融合CUDA kernel加速MoE推理,实现更高效的训练和推理。
- 实验结果:在15个基准测试中,Mono-InternVL在12个任务上优于现有单体MLLMs(如在OCRBench上比Emu3高114分);Mono-InternVL-1.5减少58%训练数据、提升26%推理速度,同时性能与Mono-InternVL相当,且首token延迟比模块化模型InternVL-1.5降低69%。
创新点
- <