news 2026/10/4 10:53:53

InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

【免费下载链接】InternVideo[ECCV2024] Video Foundation Models & Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo

InternVideo 是上海AI实验室开源的视频基础模型系列,它的核心是一套三阶段训练流程:先用无需人工标注的自监督预训练"看懂"视频,再通过图文多模态对齐学会"图文匹配",最后与 7B 语言模型拼成InternVideo2-8B 视频对话模型。本文带你完整拆解这条从数据到模型的成长路径,新手也能轻松看懂每一步在做什么。

整体思路:为什么要分三个阶段?

视频理解是比图像理解更难的任务:视频既有时序动态,又要和文本、音频对齐。InternVideo 的解法是把"能力"分层学习:

阶段目标输入数据监督信号
阶段一视觉自监督预训练纯视频无标签(掩码重建 + 教师蒸馏)
阶段二视频-文本多模态对齐图文/视频文本对对比学习 + 蒸馏 + 交叉对齐
阶段三视频对话视频 + 文本指令对话数据微调

三个阶段分别对应仓库里的三个模块:

  • 阶段一代码:InternVideo2/single_modality/run_pretraining.py
  • 阶段二代码:InternVideo2/multi_modality/
  • 阶段三(InternVideo3):InternVideo3/

阶段一:自监督预训练,让模型"看懂"视频 🎬

阶段一的核心思想是不需要任何人工标注,让视频编码器从海量视频中自学视觉表征,主要依赖两种学习信号:

  1. 生成式学习(掩码重建):随机遮盖视频中的大量时空 token(mask_type=tube管状掩码、mask_ratio=0.75),让模型根据可见部分还原被遮盖的内容。相关参数定义见 run_pretraining.py。
  2. 判别式学习(教师蒸馏):用两个强大的教师模型"带学生"——视觉教师InternVL(图像-视频 CLIP 模型)和多模态教师VideoMAEv2,让 1B 参数的学生模型对齐教师的特征。注册逻辑见 run_pretraining.py。

训练脚本非常直观,运行一条命令即可启动 1B 模型预训练:

bash ./scripts/pretraining/1B_pt.sh

对应文件位于 InternVideo2/single_modality/scripts/pretraining/。预训练完成后,你会得到一个与文本无关的通用视频编码器(InternVideo2-Stage1-1B/6B),它能提取出高质量的纯视觉特征,是后续一切能力的地基。

阶段二:视频-文本对齐,从"看懂"到"对得准" 🤝

阶段二把纯视觉编码器升级为多模态模型:在视觉编码器上接一个文本编码器(BERT 或 LLM),并引入一组互补的损失函数,让视频特征和文本特征在同一个空间里"对得准"。

核心损失配置见 scripts/pretraining/stage2/1B/config.py:

损失项作用
VTC视频-文本对比学习,拉近匹配对、推远不匹配对
MLM掩码语言建模,增强文本编码能力
VTM视频-文本匹配(含难负样本挖掘),用于检索场景

阶段一预训练的视觉编码器直接作为初始化(pretrained=1B_stage1.pth),同时保留 CLIP 教师蒸馏(clip_teacher相关参数见 config.py)。训练命令同样是单行启动:

bash scripts/pretraining/stage2/1B/run.sh

该阶段还衍生出一个CLIP 后预训练分支(scripts/pretraining/clip/),用 LLM 做文本编码器,支持中英文检索。阶段二的产出是InternVideo2-Stage2模型,在 60 多个视频/音频任务(动作识别、时间定位、图文检索等)上达到当时 SOTA,其中 Kinetics-400 动作识别准确率达92.1%。

阶段三:8B视频对话模型,会看视频还会聊天 💬

阶段三把前两阶段的成果"合体":将阶段二训练好的1B 视觉编码器与一个7B 语言模型(如 InternLM 系列)通过适配器拼接,得到InternVideo2-Stage3-8B视频对话模型。"8B"即 1B 视觉 + 7B 语言,它能直接接收视频帧和文字指令,进行视频问答、详细描述与推理。

最新的InternVideo3-8B-Instruct沿用了同样的"视觉编码器 + LLM"范式,并在此基础上强化了长视频与智能体式推理能力,其整体架构如下:

InternVideo3 的训练配方同样遵循分阶段思想:继续预训练(CPT)→ 短到长监督微调(SFT)→ 基于规则强化学习 → 在线蒸馏,详见 InternVideo3/README.md 中的 Training Recipe 章节。在公开权重的模型中,它在 Video-MME、MLVU、EgoSchema 等长视频基准上取得了领先成绩:

小结:三阶段流程一张图看懂 🧭

阶段模型规模关键能力入口代码
① 自监督预训练1B / 6B通用视频视觉表征single_modality
② 多模态对齐1B / 6B视频-文本检索与理解multi_modality
③ 视频对话8B视频问答与推理InternVideo3

这套"自监督 → 多模态对齐 → 对话微调"的三阶段训练流程,是 InternVideo 系列能同时拿下识别、检索、定位、对话等几十项任务的关键。如果你想复现或魔改,可以从 InternVideo2/single_modality/MODEL_ZOO.md 的模型列表入手,逐阶段跑通整条流水线。

【免费下载链接】InternVideo[ECCV2024] Video Foundation Models & Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/4 10:52:58

基于Java的学生选课管理系统:从技术选型到部署避坑的完整指南

简介:这份资源是面向高校计算机专业学生与Java Web初学者的一套学生选课管理系统完整项目资料,围绕教学管理场景,解决课程发布、选课退课、成绩录入与权限控制等实际业务问题,适合作为课程设计、毕业设计或Java Web入门练手参考。…

作者头像 李华
网站建设 2026/10/4 10:51:53

全文 - 第 08 章 - Principles and Practices of Interconnection Networks

第 8 章 路由基础 路由(routing)是在给定拓扑中,为分组选择从源节点到目的节点路径的过程。有了拓扑——网络的道路地图——之后,路由是顺理成章的下一步:在地图上选一条能到达目的地的路线。拓扑决定网络的理想性能&a…

作者头像 李华
网站建设 2026/10/4 10:49:51

CMake target_compile_options 完全指南:为目标精确注入编译选项

构建工具开发工具CLI 【免费下载链接】CMake Mirror of CMake upstream repository 项目地址: https://gitcode.com/gh_mirrors/cm/CMake 点击查看 免费下载 本篇技术指南以 CMake 官方命令参考文档 target_compile_options 为核心骨架,系统讲解如何为目…

作者头像 李华
网站建设 2026/10/4 10:46:09

张家界慢游指南:金鞭溪畔听水声,峰林间找回旅行松弛感

张家界这三个字,在很多人的旅行清单里挂了很久,但真到做攻略的时候,十有八九会陷入一种奇怪的焦虑:两天够不够?三天够不够?要不要把天子山、袁家界、金鞭溪、黄石寨全部刷完?我看着网上那些“张…

作者头像 李华
网站建设 2026/10/4 10:46:00

Cursor 1.0 发布后,MCP 一键接入的 Base URL 该改到 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华