该文章提出了一种基于直接偏好优化(DPO)微调大型语言模型(LLMs)的同步语音翻译(SimulST)分割框架,解决了现有分割模型缺乏人类偏好对齐的问题,在翻译质量和延迟平衡上表现更优。
一、文章主要内容总结
- 研究背景:同步语音翻译需通过精准分割平衡翻译质量与延迟,现有模型(如SHAS)依赖监督学习目标,未融入人类偏好对齐,难以满足实时自然翻译需求。
- 核心方法:构建以Qwen2.5-Omni-3B为基础的LLM分割框架,通过DPO进行微调;从CoVoST2语料库构建约8000个偏好对(结合VAD、固定长度分割等策略生成候选分割,按翻译质量和延迟排序),将分割模块与SeamlessM4T v2翻译骨干集成。
- 实验设计:在ACL 60/60语料库的英日、英中、英德三种语言对上评估,以固定长度分割、VAD分割、SHAS为基线,采用BLEU(翻译质量)和Streaming LAAL(延迟)为指标。
- 实验结果:DPO微调的LLM分割框架在三种语言对上均优于基线,如英德方向BLEU达25.5(SHAS为23.6),平均比SHAS提升约1.5个BLEU,延迟仅增加约100ms;在延迟-质量权衡上,该方法始终优于其他策略。
- 局限性:仅评估三种语言对,泛化性待验证;3B参数LLM增加计算开销,不利于资源受限设备部署;部分延迟阈值下BLEU波动,分割稳定性需提升;未进行人工评估。