news 2026/8/19 18:04:10

实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告

实测数据公开:Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4上的吞吐量与延迟报告

【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU

核心结论先行:Voxtral-Mini-4B-Realtime-2602-NPU 是 Mistral AI 实时语音转写模型 Voxtral Mini 4B Realtime 2602 在昇腾 910B4 NPU 上的开源部署项目,基于 torch_npu 昇腾推理引擎与 transformers ≥ 5.2.0 原生实现「音频 → 文本」全流程。本文公开其真实跑分数据:模型加载仅约 5 秒,平均生成吞吐量最高 24.7 tok/s,转写一段 15.9 秒英文音频最快仅需约 4.17 秒,实时率 RTF≈0.26,处理速度明显快于音频播放速度,为实时字幕、语音助手等场景提供了扎实的性能参考。

为什么关心昇腾910B4上的实时语音转写性能?

Voxtral Mini 4B Realtime 2602 是 Mistral AI 开源的首批原生流式实时语音转写模型之一,设计目标是在 500ms 端到端延迟内达到接近离线系统的转写精度,支持 13 种语言,天然适配实时字幕、会议转写、语音助手等场景。昇腾 910B4 则是国产 AI 推理的主力芯片,模型能否在这类芯片上流畅跑通,直接决定了国产化部署的可行性。

本项目正是为了回答这个问题而诞生:完整的部署方案见 README.md,核心推理脚本为 inference.py,NPU 兼容补丁见 sitecustomize.py,依赖清单见 requirements.txt。下面直接公开昇腾910B4单卡上的实测吞吐量与延迟数据。

测试环境一览:昇腾910B4 硬件与软件版本

所有数据均来自同一套稳定环境,保证可复现:

组件版本 / 配置
NPU 硬件Ascend 910B4(单卡 64GB HBM)
CANN8.5.1
torch / torch_npu2.9.0 / 2.9.0.post1
transformers5.15.0
mistral-common1.11.7([audio] 扩展)
Python3.11.14
模型权重bf16,约 8.8GB(文本 LLM ≈ 3.4B + 音频编码器 ≈ 970M)

如上图npu-smi监控所示,Ascend 910 芯片健康状态为 OK,推理过程中 HBM 占用仅约 3GB / 64GB,温度 40℃ 左右,说明 8.8GB 权重的 Voxtral-Mini-4B 在昇腾910B4上运行非常轻松,显存余量充足。

实测吞吐量:Voxtral-Mini-4B 在昇腾NPU上的生成速度

吞吐量是衡量实时语音转写模型「每秒钟能吐出多少个 token」的关键指标。本次使用同一段约 15.9 秒英文音频(爱迪生留声机经典录音),测试两组不同输出长度:

测试用例max_new_tokens生成 tokens总耗时平均吞吐量
用例一20023912.49s19.1 tok/s
用例二641034.17s24.7 tok/s

从数据可以看出两个规律:

  • 短输出场景吞吐量更高:用例二平均 24.7 tok/s,约 40ms/token;用例一约 52ms/token;
  • 输出越长,生成阶段注意力计算开销占比越大,平均速度会小幅下降,这是滑窗注意力模型的正常表现。

上图是昇腾NPU上语音转写模型推理的终端日志示例,可以看到模型加载、输入音频时长、输出 token 数、单次生成延迟等关键指标都会被清晰打印出来,方便复现时逐项核对。

实测延迟:从模型加载到转写完成需要多久?

延迟决定了「用户体验」,我们拆成两个阶段来看:

阶段实测耗时
模型加载(一次性开销)约 5.0 – 5.1s
用例一:转写 239 tokens12.49s(RTF≈0.79)
用例二:转写 103 tokens4.17s(RTF≈0.26)

这里的 RTF(Real-Time Factor,实时率)是语音转写最直观的延迟指标:RTF < 1 表示转写速度快于音频实时播放。用例二 RTF≈0.26,意味着 1 秒音频只需约 0.26 秒即可完成转写,为流式实时场景留下了充足余量;即使输出较长的用例一也达到 RTF≈0.79,仍然快于实时播放。此外,模型加载约 5 秒属于一次性开销(服务启动时完成),不影响线上推理延迟。

吞吐量与延迟的权衡:max_new_tokens 如何影响性能

实时语音转写场景常常需要在「响应更快」和「转写更全」之间做取舍,实测数据恰好说明了这一点:

  • --max-new-tokens控制最大生成 token 数:设小(如 64)响应更快、吞吐更高;
  • 模型本身支持transcription_delay_ms(80–1200ms 及 2400ms)档位,可在延迟与精度之间灵活权衡;
  • 流式设计上,单条转写文本 token 对应约 80ms 音频,配合因果音频编码器 + 滑窗注意力 LLM,理论上可支持近乎无限的流式输入。

建议业务方按场景选择:实时字幕偏短句优先(低延迟、高吞吐),会议纪要偏完整转写(可接受略长延迟)。

复现步骤:在昇腾910B4上快速跑通性能测试

以上数据都可以一键复现:

git clone https://gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU cd Voxtral-Mini-4B-Realtime-2602-NPU python3 -m venv --system-site-packages venv ./venv/bin/pip install -r requirements.txt ./venv/bin/python inference.py --audio sample_en.wav --max-new-tokens 64

运行后终端会打印「生成 N tokens,耗时 X.XXs,平均 Y.Y tok/s」,与本文数据直接对比即可验证。仓库自带sample_en.wav测试音频,也可以换成任意 wav/mp3/ogg 文件,脚本会自动重采样到 16kHz。

上图展示了本项目从收集上下文、模型分析、环境装配到推理验证、经验总结的完整可复现工作流,同样适用于其他语音模型在昇腾910B4上的适配。

性能解读与优化建议

  • 精度选择:默认 bf16 即可在昇腾910B4上兼顾速度与精度,无需 float32;
  • 显存余量:权重 8.8GB 对 64GB HBM 来说非常宽裕,可尝试更大 batch 或更长上下文;
  • 服务化路径:项目已完成 vLLM-Ascend 框架侧适配(服务可正常启动),待 whisper-causal 注意力上游支持后,可获得更高并发吞吐,值得持续关注;
  • 场景匹配:短输出场景吞吐更高(24.7 tok/s),实时字幕类「短句优先」业务最受益。

总结:昇腾910B4 能否胜任实时语音转写?

答案是肯定的。实测数据显示,Voxtral-Mini-4B-Realtime-2602-NPU 在昇腾910B4单卡上实现了 19.1–24.7 tok/s 的生成吞吐量与 RTF≈0.26 的转写延迟,处理速度明显快于音频播放,完全满足实时语音转写的性能门槛。如果你正在做国产化 NPU 上的语音 AI 落地,这份实测报告与完整代码可以直接作为起点。

【免费下载链接】Voxtral-Mini-4B-Realtime-2602-NPU项目地址: https://ai.gitcode.com/z_studio/Voxtral-Mini-4B-Realtime-2602-NPU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/19 18:04:06

零基础打造ESP32无人机:5个关键步骤快速实现组装与首飞

零基础打造ESP32无人机&#xff1a;5个关键步骤快速实现组装与首飞 【免费下载链接】esp-drone Mini Drone/Quadcopter Firmware for ESP32 and ESP32-S Series SoCs. 项目地址: https://gitcode.com/GitHub_Trending/es/esp-drone 想亲手做一架无人机&#xff0c;却被&…

作者头像 李华
网站建设 2026/8/19 18:01:39

Una UI配置完全指南:nuxt.config与app.config的12个关键配置项

Una UI配置完全指南&#xff1a;nuxt.config与app.config的12个关键配置项 【免费下载链接】una-ui The Atomic UI framework for Nuxt, powered by Unocss engine &#x1f49b; 项目地址: https://gitcode.com/gh_mirrors/un/una-ui 想要快速上手 Una UI配置&#xff…

作者头像 李华
网站建设 2026/8/19 17:51:13

eSearch 离线 OCR 终极指南:截屏提取文字,再一键翻译搜索

eSearch 离线 OCR 终极指南&#xff1a;截屏提取文字&#xff0c;再一键翻译搜索 【免费下载链接】eSearch 截屏 离线OCR 搜索翻译 以图搜图 贴图 录屏 万向滚动截屏 屏幕翻译 Screenshot Offline OCR Search Translate Search for picture Paste the picture on the screen Sc…

作者头像 李华
网站建设 2026/8/19 17:49:31

AMD ROCm环境搭建指南:为Instella-MoE-16B-A3B-Midtrain铺平第一条路

AMD ROCm环境搭建指南&#xff1a;为Instella-MoE-16B-A3B-Midtrain铺平第一条路 【免费下载链接】Instella-MoE-16B-A3B-Midtrain 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Instella-MoE-16B-A3B-Midtrain AMD ROCm环境搭建是运行 Instella-MoE-16B-A3B-Midt…

作者头像 李华