0.69B 多模态小模型:拼接微调如何给中文模型装上眼睛
【免费下载链接】happy-llm📚 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm
把 SmolVLM2 的视觉模块嫁接到 Qwen3-0.6B 上,用 0.69B 参数、约 4GB 显存跑通中文看图问答。这套小模型多模态的拼接微调方案,改动点只有三处,一篇讲完。
模型内部长什么样 ✅
SmolVLM2 就三块:视觉塔(SigLip-93M)把图像编码成 768 维特征序列;特征映射层(一个带 Pixel Shuffle 降采样的 MLP)把视觉特征从 768 维拉到语言模型需要的维度;语言模型(SmolLM2-135M)把图像特征和文本嵌入拼在一起做序列预测。没有交叉注意力,视觉和文本就是直接 concat——这正是它适合当"供体"的原因:语言部分拆下来换掉就行,类似换发动机但不动底盘。
要动的只有两处:SmolLM2 整个换成 Qwen3-0.6B,映射层重建。视觉塔 93M 参数原封不动。
跑通它需要做的几个动作
改上下文模板
Qwen3 的 chat template 里有 `
【免费下载链接】happy-llm📚 从零开始构建大模型项目地址: https://gitcode.com/GitHub_Trending/ha/happy-llm
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考