70B 参数以内「动作识别」模型选型(截止 2026 年 8 月,开源)
先区分两条路线,选型最重要前提:
- 纯动作分类(闭集 / 给定类别、不需要自然语言描述):专用视频基础模型 >> 通用 Video-LLM
- 开放集动作识别、视频问答、动作时序描述、自然语言输出:选视频大语言模型(VideoLLM)
所有模型参数均<70B,不含 72B/70B 档位
一、【首选路线 1|专用视频基础模型(分类任务天花板)】
适合:安防行为识别、体育动作分类、Kinetics/UCF101 微调、特征提取、零样本动作检索
🏆 综合最强:InternVideo2-6B(智源)
- 参数:6B
- 优势:时序建模业内标杆,原生针对视频运动预训练;K400 零样本 / 微调指标碾压同规模通用多模态模型;支持动作特征抽取、时序定位、视频检索
- 基准:K400 Finetune Top192.1%;细粒度动作区分强,运动模糊、快速动作鲁棒性优于 Qwen/LLaVA 系列
- 缺点:不是对话模型,无法直接自然语言问答;只能输出特征 / 分类结果,需要自己封装 LLM 做上层理解
- 适用:离线动作数据集训练、视频特征库、工业行为分类
备选轻量:InternVideo2-1B,算力紧张首选,性价比极高
次选:ViCLIP(InternVideo 衍生)
主打零样本开放集动作检索,不需要微调,直接文本 - 视频动作匹配;适合不知道动作类别、开放词汇检索场景
二、【首选路线 2|通用 Video-LLM(开放集 + 自然语言动作理解,绝大多数开发者需求)】
适合:输入视频 → 自然语言输出「识别动作、先后顺序、细粒度动作差异、多人动作」,零样本直接推理,不用重新训练分类头
🏅 综合第一(中文 + 时序动作均衡):Qwen2.5-VL-7B-Instruct(阿里通义千问)
- 参数:7B
- 优势: ✅ 中文理解最强,社区生态最完善、推理框架(vLLM/llama.cpp)全面支持 ✅ 动态帧采样原生支持长视频,连续动作序列识别稳定;幻觉相对可控 ✅ 商用友好开源协议;硬件门槛低,单卡 24G 可 4bit 量化运行
- 短板:极高速细微动作(类似动作区分)略弱于 InternVideo2;纯零样本分类基准弱于专用视频模型
- 最佳场景:通用视频动作问答、监控画面行为描述、人机交互视频分析
🥈 时序运动理解专项更强:LLaVA-OneVision-2 7B
- 参数:7B
- 优势:改进时序注意力机制;跳跃动作、高速运动、短时连续动作识别显著优于原版 LLaVA-Video、早期 Qwen-VL JumpScore 运动基准大幅领先,擅长区分细微相似动作(挥手 / 拍打、慢跑 / 快走)
- 短板:中文能力弱于 Qwen;长视频上下文容易丢失时序信息
🥉 动作识别专项微调版(学术场景):LLaVAction-7B
基于 LLaVA-Video 专门在 EPIC-KITCHENS 动作数据集微调;厨房、人手操作、精细交互动作效果极强。 缺点:通用场景泛化一般,只适合近距离人体手部动作。
进阶备选:VideoLLaMA3-7B
音频 + 视频多模态,如果你需要结合声音辅助动作识别(尖叫、撞击 + 行为)优先选它;纯视觉动作略逊 OneVision2
三、如果算力充足,上限更高(仍然 < 70B)
InternVideo2-Chat-34B34B 视频对话模型,融合 InternVideo 强大时序编码器 + 语言头;70B 以内视频时序理解天花板,高速运动、多人复杂动作序列最强。 缺点:显存要求高(4bit 至少 32G 显存),推理成本高于 7B 模型。
最简选型速查表(直接对照场景选)
表格
| 使用场景 | 最优模型 |
|---|---|
| 闭集动作分类、数据集微调、视频特征提取 | InternVideo2-6B |
| 零样本开放集动作检索(无训练数据) | ViCLIP |
| 中文环境、视频动作自然语言问答(通用项目,最常用) | Qwen2.5-VL-7B-Instruct |
| 大量高速运动、细微动作区分(体育、格斗、肢体动作) | LLaVA-OneVision-2 7B |
| 手部精细操作、厨房 / 装配动作识别 | LLaVAction-7B |
| 需要音频 + 视频联合识别动作 | VideoLLaMA3-7B |
| 不差算力、追求 70B 以内动作理解极限 | InternVideo2-Chat-34B |
重要避坑提醒
- 不要混淆「图像多模态模型」和原生视频模型:普通静态 VL(LLaVA1.5、Qwen-VL 初代)只是抽多张图,没有时序建模,动作识别效果很差;务必选原生 Video 版本。
- 通用 Video-LLM 做大规模标准化动作分类任务,性能永远低于 InternVideo 这类专用视频基础模型;优先区分任务,不要盲目用对话大模型做分类。
- 开放集工业落地最佳组合方案:
InternVideo2(特征提取+动作候选) + Qwen2.5-VL-7B(自然语言校验、动作描述、逻辑推理)
如果你告诉我:是否需要中文、显卡显存、是做分类还是视频问答、是否允许微调,我可以直接给出唯一最优选择 + 推荐推理参数(采样帧数、量化方案)。