Audio8 ASR Infinite 基准测试解读:中文流式识别误差为何骤降 10 倍
【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite
Audio8 ASR Infinite 是一个原生流式语音识别(ASR)模型,支持中英双语实时转写。它的官方基准测试显示:在 aishell1 中文测试集上,字错误率(CER)仅为1.750%,而同等流式条件下的 Voxtral-Mini-4B-Realtime 为 16.795%——误差直接缩小了约 10 倍。这篇指南带你读懂这份基准测试数据背后的含义、架构原理和三个可调配置项。
一、先看结论:基准测试数据一览
官方在 80ms 音频时钟、target_delay_ms = 480(即等待 480 毫秒再输出对应文字)的设置下,用贪心解码跑了以下测试:
| 测试集 | 指标 | Audio8 ASR Infinite | Voxtral-Mini-4B-Realtime | nemotron-3.5-asr-streaming-0.6b |
|---|---|---|---|---|
| aishell1/test(中文) | CER | 1.750 | 16.795 | 12.927 @560ms |
| aishell4/test(中文) | CER | 2.893 | 16.456 | 14.677 @560ms |
| librispeech test.clean(英文) | WER | 3.042 | 2.210 | 3.353 @560ms |
| librispeech test.other(英文) | WER | 6.808 | 5.552 | 7.140 @560ms |
| 四组平均 | 3.623 | 10.253(2 组) | 9.524 |
数据来自 README.md 的 Evaluation 一节。几个关键读法:
- “骤降 10 倍”从哪来:aishell1 上 16.795 → 1.750,误差缩小约 9.6 倍,约等于“降了 10 倍”;aishell4 上也缩小了约 5.7 倍。中文场景优势明显。
- 公平性注意:对比模型标注的是
@560ms延迟,而 Audio8 用的是 480ms——更短的等待时间反而更低的误差率,含金量更高。 - 英文是短板:两组 Librispeech 上 Audio8 均不敌 Voxtral(3.042 vs 2.210)。它的优势集中在中文流式场景。
二、误差为什么能降这么多:三个架构原因
1. 更快的“感知时钟”:每秒解码 12.5 次
普通流式 ASR 往往每隔几百毫秒才决策一次,Audio8 选择了80ms 音频时钟——每 80ms 音频就产出一个文本 token,即每秒做 12.5 次识别决策。感知粒度更细,漏字、错字的概率自然下降。
对应的配置可以在 config.json 中看到:streaming_frame_ms、frame_lens: [4, 6, 8]分别对应 80/120/160ms 三档时钟。
2. 延迟可配置:用多少等待换多少精度
target_delay_ms控制“听到音频后等几毫秒再输出文字”。config.json 中的num_delay_tokens_by_frame_len把延迟换算成了具体 token 数,例如 80ms 时钟下:
| 目标延迟 | 240ms | 320ms | 480ms | 560ms |
|---|---|---|---|---|
| 延迟 token 数 | 3 | 4 | 6 | 7 |
延迟越长,模型能参考的音频上下文越多,通常越准——但它把 240~560ms 都做成了可选项,让你在不同业务场景下自行权衡“响应快”和“识别准”。
3. 滚动 KV Cache:长录音不漂移
标题里的 “Infinite” 就体现在这里:传统流式模型转写越久,KV 缓存越长,显存和延迟会持续膨胀。Audio8 使用Rolling KV Cache + 精确 RoPE 重基化,把上下文窗口滚动固定在约 30 秒,显存和延迟恒定,可以 24/7 不间断转写长音频而不会漂移。模型结构细节见 modeling_audio8_asr_infinite.py 的文件头注释——它继承了 Voxtral Realtime 的延迟条件机制(延迟 token 数 → 正弦时间嵌入 → 逐层自适应 MLP → 注意力后隐层缩放)。
三、顺手了解:语义 VAD 解决“什么时候该停”
传统声学 VAD 只能判断“有没有声音”,分不清思考停顿、口吃、真正的发言结束。Audio8 额外训练了一个语义 VAD 头(semantic_vad_heads.safetensors),在 0.5s / 1.0s / 2.0s / 3.0s 四个未来时间点上各有一个 8 分类器,预测接下来会出现多少个语义单元——第 0 类就是“该断句了”。这让实时对话系统能精准地在真正句尾切分,而不是把思考停顿误判成结束。
四、上手提示:选择推荐的“时钟 × 延迟”组合
并非所有组合都经过后训练调优,官方推荐这三组(见 README.md 的 Optimized operation points):
| 音频时钟 | frame_len | 推荐 target_delay_ms | 适合场景 |
|---|---|---|---|
| 80 ms | 4 | 240 / 320 / 480 / 560 | 追求最低误差(基准测试配置) |
| 120 ms | 6 | 240 / 480 | 均衡响应与精度 |
| 160 ms | 8 | 320 / 480 | 资源受限环境 |
💡 经验法则:中文转写优先选 80ms 时钟 + 480ms 延迟(基准测试同款配置);对实时性极敏感的客服/会议场景可降到 240ms,用少量精度换速度。
模型本体为 8.17 GB 的 model.safetensors(bfloat16),音频塔 32 层 + Qwen2.5-3B-Instruct 36 层解码器,整体约 4B 级别参数规模。
五、小结 📌
- 中文流式识别误差率骤降 10 倍:aishell1 CER 从 16.8% 降到 1.75%,且延迟还更短(480ms vs 560ms)
- 代价是英文场景仍略逊于 Voxtral-Mini-4B-Realtime
- 80ms 时钟(12.5 次/秒决策)+ 可配置延迟 + 滚动 KV Cache,是低误差与“无限时长”同时成立的关键
- 面向实时对话、会议转写、客服录音等中文为主的流式场景,这是目前值得重点评估的开源方案之一
如需实际部署,官方推荐 Docker Compose 方式一键启动(README 中“24/7 inference with vLLM”一节),配合 Web 客户端即可体验实时转写效果。
【免费下载链接】Audio8-ASR-Infinite项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Audio8-ASR-Infinite
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考