news 2026/8/26 19:58:03

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B

InternVL3.5-4B 是 OpenGVLab 开源的轻量级多模态大模型,总参数量约 4.7B,采用经典的「ViT-MLP-LLM」架构:InternViT-300M 视觉编码器 + MLP 投影层 + Qwen3-4B 语言模型。本文逐层拆解这套多模态范式的实现细节,讲清它如何把一张图片变成视觉 token 序列并交给 LLM,帮助新手彻底看懂轻量级 VLM 的架构原理。

💡 30 秒概览:三个「零件」拼成一个模型

组件模型参数量职责
视觉编码器InternViT-300M0.3B切图、提取视觉特征
投影层Pixel Shuffle + MLP约几 M压缩视觉 token、对齐维度
语言模型Qwen3-4B4.4B多模态理解、推理与生成

关键数字:每个 448×448 图像切片最终转换为256 个<IMG_CONTEXT>视觉 token;一张原图会被动态切成1~12 个切片 + 1 张缩略图(见config.json中的max_dynamic_patch=12downsample_ratio=0.5)。

📐 数据流全景:一张图如何变成回答

  1. 动态切图:按最接近的宽高比把原图切成 1~12 个 448×448 切片,再附一张缩略图;
  2. 视觉编码:每个切片进入 InternViT(24 层 Transformer),448÷14=32,得到 32×32=1024 个 patch 特征 + 1 个 CLS token;
  3. token 压缩:pixel shuffle 把 1024 个 token 压成 256 个(每个 token 维度变为 4 倍);
  4. 投影对齐mlp1把 4096 维映射到 Qwen3 的 2560 维;
  5. 占位替换:输入 embedding 序列中的<IMG_CONTEXT>占位符逐个换成视觉特征(见modeling_internvl_chat.pyforward);
  6. 自回归生成:Qwen3-4B 基于「文本 + 视觉」混合序列生成回答。

🔍 第一层:InternViT 视觉编码器

实现在modeling_intern_vit.py,关键参数来自config.jsonvision_config段:

参数含义
num_hidden_layers24Transformer 层数
hidden_size1024隐层维度
num_attention_heads16注意力头数
patch_size14切片窗口大小(像素)
image_size448每个切片分辨率
hidden_act / normgelu / layer_norm激活与归一化方式

几个值得留心的设计细节:

  • 可插值位置编码_get_pos_embed用双三次插值把 32×32 的位置编码表重采样,因此任意尺寸的切片都能拿到合适的位置信息;
  • LayerScale + DropPath:每层带ls1/ls2缩放参数和随机深度(drop_path_rate=0.1),让大视觉编码器训练更稳;
  • FlashAttention 加速:配置了use_flash_attn=true,自注意力走flash_attn_varlen_qkvpacked_func快速路径。

「动态高分辨率」由config.jsondynamic_image_size=truemin_dynamic_patch=1max_dynamic_patch=12use_thumbnail=true共同控制:小图只切 1 块,信息量大的图表、文档则最多切 12 块「看得更仔细」,兼顾精度与开销。

🧮 第二层:MLP 投影层——视觉与语言之间的「翻译官」

这是 ViT-MLP-LLM 中「MLP」的核心,位于modeling_internvl_chat.pyInternVLChatModel.__init__

  • pixel shuffledownsample_ratio=0.5):把 32×32 网格的 1024 维特征重排为 16×16 网格的 4096 维特征,token 数从 1024 压到 256,序列长度骤降 4 倍;
  • mlp1LayerNorm(4096) → Linear(4096→2560) → GELU → Linear(2560→2560),完成到 Qwen3 隐层维度的对齐。

算一笔账:一张 12 切片 + 缩略图的图像会注入 256×13 =3328 个 token——这就是多模态对话为什么特别「吃」上下文窗口的原因。

🤖 第三层:Qwen3-4B 语言模型

参数定义在config.jsonllm_config段(架构为Qwen3ForCausalLM):

参数参数
num_hidden_layers36hidden_size2560
num_attention_heads32num_key_value_heads8(GQA)
intermediate_size9728max_position_embeddings40960
rope_theta1,000,000vocab_size151,936
hidden_actsiluattention_biasfalse

两个亮点:分组查询注意力(32 个 Q 头共享 8 个 KV 头)显著降低推理时的 KV 缓存占用;40K 上下文足以容纳多张高分辨率图 + 长文档对话。

🏋️ 训练管线:四步走到最终版本

README.md说明,InternVL3.5-4B 依次经历:

  1. CPT(多模态持续预训练):文本 + 多模态语料联合训练,配合平方根加权的最下一个词预测损失;
  2. SFT(监督微调):32K 上下文,引入「思考模式」推理数据;
  3. MPO(离线强化学习):DPO + BCO + LM 三项损失组合——当前仓库模型的直接基座(README.mdbase_model指向InternVL3_5-4B-MPO);
  4. GSPO(在线强化学习):级联强化学习收尾,MMMU、MathVista 等推理基准大幅提升。

🚀 快速上手:最低门槛的部署方式

环境要求transformers>=4.52.1,单张 24G 显存 GPU 即可跑起来(官方说明 30B 及以下可单卡 A100 部署,4B 更轻松):

import torch from transformers import AutoModel, AutoTokenizer path = "OpenGVLab/InternVL3_5-4B" model = AutoModel.from_pretrained( path, torch_dtype=torch.bfloat16, low_cpu_mem_usage=True, use_flash_attn=True, trust_remote_code=True, device_map="auto").eval() tokenizer = AutoTokenizer.from_pretrained(path, trust_remote_code=True) question = '<image>\nPlease describe the image shortly.' # pixel_values 由动态切图得到(完整示例见 README.md 的 load_image) response = model.chat(tokenizer, pixel_values, question, dict(max_new_tokens=1024, do_sample=True))

要开启「思考模式」,只需把系统提示词换成官方 R1 提示并设置do_sample=Truetemperature=0.6。在线服务场景可直接用 vLLM 或 LMDeploy 起 OpenAI 兼容 API:lmdeploy serve api_server OpenGVLab/InternVL3_5-4B --server-port 23333 --tp 1

📁 关键文件速查

文件作用
config.json顶层配置 +vision_config+llm_config三段式结构
modeling_intern_vit.pyInternViT 视觉编码器(Embeddings / Attention / Encoder)
configuration_intern_vit.pyViT 配置类(本模型覆盖为 24 层)
modeling_internvl_chat.py主模型:pixel shuffle、mlp1、chat / generate 逻辑
configuration_internvl_chat.py组合式配置,把 vision 与 LLM 配置拼装在一起
conversation.py对话模板(本模型使用internvl2_5模板)
special_tokens_map.json<img><IMG_CONTEXT><box>等特殊 token
chat_template.jinja新版 transformers 的聊天模板

📌 写在最后

InternVL3.5-4B 用 4.7B 的体量证明:ViT-MLP-LLM 范式简单却高效——InternViT 负责「看」,pixel shuffle + MLP 负责「压缩」,Qwen3-4B 负责「想与说」。动态高分辨率切图让它能看清细节,级联强化学习训练让它具备数学与图表推理能力,是理解开源多模态大模型架构的绝佳入口。

【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/26 19:47:47

2026毕业避坑[特殊字符]别乱买论文工具!这一个免费全能款就够了

每年毕业季&#xff0c;都有一大批学生踩坑交智商税。花钱开通多款AI论文工具会员、反复付费查重、盲目用通用AI改稿&#xff0c;最后不仅花光生活费&#xff0c;论文还因为AI痕迹超标、重复率不稳、格式出错被导师打回。 尤其是2026年高校全面落实重复率AIGC双重检测机制&…

作者头像 李华
网站建设 2026/8/26 19:45:49

大型量产固件的工程实践(十一):健壮的网络状态机——链路监控与指数退避重连

大型量产固件的工程实践(十一):健壮的网络状态机——链路监控与指数退避重连 本文是《大型量产固件的工程实践》专栏第 11 篇。 上一篇:第 10 篇《嵌入式状态机设计》 | 本文是专栏最后一篇 一、网络初始化为什么也要状态机 网络是嵌入式里"最容易出幺蛾子"的模…

作者头像 李华
网站建设 2026/8/26 19:35:18

AI 时代营销正在变天,很多企业还在沿用搜索时代的旧思路

当大模型深度渗透商业决策&#xff0c;不少企业的获客逻辑却还停留在网页搜索时代。竞价广告、信息流投放、传统 SEO&#xff0c;这些过去十几年行之有效的营销手段&#xff0c;正在面临一个客观现实&#xff1a;用户获取信息的入口已经发生迁移。现在大量 B 端采购、产品选型、…

作者头像 李华