📖标题:Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning
🌐来源:arXiv, 2608.19669v1
🛎️文章简介
🔸研究问题:如何克服现有多模态潜在推理框架中监督微调阶段目标次优及强化学习阶段缺乏有效探索的局限?
🔸主要贡献:论文提出Scaffolding Minds框架,通过可学习的支架编码器和自适应高斯采样策略,显著提升了多模态推理性能。
📝重点思路
🔸针对监督微调阶段,摒弃使用冻结的通用视觉编码器生成潜在目标的做法,转而训练一个专用的“支架编码器”。该编码器通过下游任务损失端到端地优化,将辅助图像映射为对推理任务最敏感的潜在目标表示,从而提供更优质的监督信号。
🔸针对强化学习阶段,提出“支架RL”方法,取代传统的确定性正则化。该方法引入两个轻量级头部,根据生成的潜在先验动态学习高斯分布的均值和方差,并在 rollout 过程中对残差潜在动作进行采样。这使得模型能够直接探索替代性的潜在推理轨迹,利用奖励信号优化潜在空间的搜索。
🔸在推理阶段,支架编码器和辅助图像被丢弃,仅保留经过微调的大语言模型和轻量级调整头,确保了推理效率与基线模型相当,同时实现了两阶段改进的互补增益。
🔎分析总结
🔸在FrozenLake空间规划任务上,该方法相比最强的潜在推理基线平均准确率提升9.5%,且在难度最高的32x32网格上优势扩大至19%,证明其在复杂多步推理中的鲁棒性。
🔸在九个以视觉为中心的推理基准测试中,该方法平均准确率提升5.2%,尤其在需要细粒度视觉区分和空间判别的数据集上表现突出,验证了优化后的潜在目标能更好地捕捉关键视觉证据。
🔸消融实验表明,支架编码器带来的目标优化是性能提升的主要驱动力,而支架RL通过有效的潜在空间探索进一步巩固了成果,两者结合效果最佳,且推理延迟仅增加约4.6%。
💡个人观点
论文指出了现有潜在推理范式中“目标静态”与“探索缺失”的核心痛点,通过设计可学习的中间表示目标和动态采样机制,让模型在连续潜在空间中真正学会“思考”而非仅仅记忆特征。