实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告
【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU
核心结论先行:Voxtral-Mini-4B-Realtime-2602-NPU 是 Mistral AI 实时语音转写模型 Voxtral Mini 4B Realtime 2602 在昇腾 910B4 NPU 上的开源部署项目,基于 torch_npu 昇腾推理引擎与 transformers ≥ 5.2.0 原生实现「音频 → 文本」全流程。本文公开其真实跑分数据:模型加载仅约 5 秒,平均生成吞吐量最高 24.7 tok/s,转写一段 15.9 秒英文音频最快仅需约 4.17 秒,实时率 RTF≈0.26,处理速度明显快于音频播放速度,为实时字幕、语音助手等场景提供了扎实的性能参考。
为什么关心昇腾910B4上的实时语音转写性能?
Voxtral Mini 4B Realtime 2602 是 Mistral AI 开源的首批原生流式实时语音转写模型之一,设计目标是在 500ms 端到端延迟内达到接近离线系统的转写精度,支持 13 种语言,天然适配实时字幕、会议转写、语音助手等场景。昇腾 910B4 则是国产 AI 推理的主力芯片,模型能否在这类芯片上流畅跑通,直接决定了国产化部署的可行性。
本项目正是为了回答这个问题而诞生:完整的部署方案见 README.md,核心推理脚本为 inference.py,NPU 兼容补丁见 sitecustomize.py,依赖清单见 requirements.txt。下面直接公开昇腾910B4单卡上的实测吞吐量与延迟数据。
测试环境一览:昇腾910B4 硬件与软件版本
所有数据均来自同一套稳定环境,保证可复现:
| 组件 | 版本 / 配置 |
|---|---|
| NPU 硬件 | Ascend 910B4(单卡 64GB HBM) |
| CANN | 8.5.1 |
| torch / torch_npu | 2.9.0 / 2.9.0.post1 |
| transformers | 5.15.0 |
| mistral-common | 1.11.7([audio] 扩展) |
| Python | 3.11.14 |
| 模型权重 | bf16,约 8.8GB(文本 LLM ≈ 3.4B + 音频编码器 ≈ 970M) |
如上图npu-smi监控所示,Ascend 910 芯片健康状态为 OK,推理过程中 HBM 占用仅约 3GB / 64GB,温度 40℃ 左右,说明 8.8GB 权重的 Voxtral-Mini-4B 在昇腾910B4上运行非常轻松,显存余量充足。
实测吞吐量:Voxtral-Mini-4B 在昇腾NPU上的生成速度
吞吐量是衡量实时语音转写模型「每秒钟能吐出多少个 token」的关键指标。本次使用同一段约 15.9 秒英文音频(爱迪生留声机经典录音),测试两组不同输出长度:
| 测试用例 | max_new_tokens | 生成 tokens | 总耗时 | 平均吞吐量 |
|---|---|---|---|---|
| 用例一 | 200 | 239 | 12.49s | 19.1 tok/s |
| 用例二 | 64 | 103 | 4.17s | 24.7 tok/s |
从数据可以看出两个规律:
- 短输出场景吞吐量更高:用例二平均 24.7 tok/s,约 40ms/token;用例一约 52ms/token;
- 输出越长,生成阶段注意力计算开销占比越大,平均速度会小幅下降,这是滑窗注意力模型的正常表现。
上图是昇腾NPU上语音转写模型推理的终端日志示例,可以看到模型加载、输入音频时长、输出 token 数、单次生成延迟等关键指标都会被清晰打印出来,方便复现时逐项核对。
实测延迟:从模型加载到转写完成需要多久?
延迟决定了「用户体验」,我们拆成两个阶段来看:
| 阶段 | 实测耗时 |
|---|---|
| 模型加载(一次性开销) | 约 5.0 – 5.1s |
| 用例一:转写 239 tokens | 12.49s(RTF≈0.79) |
| 用例二:转写 103 tokens | 4.17s(RTF≈0.26) |
这里的 RTF(Real-Time Factor,实时率)是语音转写最直观的延迟指标:RTF < 1 表示转写速度快于音频实时播放。用例二 RTF≈0.26,意味着 1 秒音频只需约 0.26 秒即可完成转写,为流式实时场景留下了充足余量;即使输出较长的用例一也达到 RTF≈0.79,仍然快于实时播放。此外,模型加载约 5 秒属于一次性开销(服务启动时完成),不影响线上推理延迟。
吞吐量与延迟的权衡:max_new_tokens 如何影响性能
实时语音转写场景常常需要在「响应更快」和「转写更全」之间做取舍,实测数据恰好说明了这一点:
--max-new-tokens控制最大生成 token 数:设小(如 64)响应更快、吞吐更高;- 模型本身支持
transcription_delay_ms(80–1200ms 及 2400ms)档位,可在延迟与精度之间灵活权衡; - 流式设计上,单条转写文本 token 对应约 80ms 音频,配合因果音频编码器 + 滑窗注意力 LLM,理论上可支持近乎无限的流式输入。
建议业务方按场景选择:实时字幕偏短句优先(低延迟、高吞吐),会议纪要偏完整转写(可接受略长延迟)。
复现步骤:在昇腾910B4上快速跑通性能测试
以上数据都可以一键复现:
git clone https://gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU cd Voxtral-Mini-4B-Realtime-2602-NPU python3 -m venv --system-site-packages venv ./venv/bin/pip install -r requirements.txt ./venv/bin/python inference.py --audio sample_en.wav --max-new-tokens 64运行后终端会打印「生成 N tokens,耗时 X.XXs,平均 Y.Y tok/s」,与本文数据直接对比即可验证。仓库自带sample_en.wav测试音频,也可以换成任意 wav/mp3/ogg 文件,脚本会自动重采样到 16kHz。
上图展示了本项目从收集上下文、模型分析、环境装配到推理验证、经验总结的完整可复现工作流,同样适用于其他语音模型在昇腾910B4上的适配。
性能解读与优化建议
- 精度选择:默认 bf16 即可在昇腾910B4上兼顾速度与精度,无需 float32;
- 显存余量:权重 8.8GB 对 64GB HBM 来说非常宽裕,可尝试更大 batch 或更长上下文;
- 服务化路径:项目已完成 vLLM-Ascend 框架侧适配(服务可正常启动),待 whisper-causal 注意力上游支持后,可获得更高并发吞吐,值得持续关注;
- 场景匹配:短输出场景吞吐更高(24.7 tok/s),实时字幕类「短句优先」业务最受益。
总结:昇腾910B4 能否胜任实时语音转写?
答案是肯定的。实测数据显示,Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4单卡上实现了 19.1–24.7 tok/s 的生成吞吐量与 RTF≈0.26 的转写延迟,处理速度明显快于音频播放,完全满足实时语音转写的性能门槛。如果你正在做国产化 NPU 上的语音 AI 落地,这份实测报告与完整代码可以直接作为起点。
【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考