news 2026/7/31 21:39:04

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

CrisperWhisper2.0_large是一款专业级语音识别工具,能够提供精准的逐字记录和预期内容转录,支持多语言识别与实时时间戳功能,让你轻松应对各种语音转文本需求。

🌟 CrisperWhisper2.0_large核心优势

CrisperWhisper2.0_large作为一款先进的语音识别模型,具有以下突出特点:

✅ 双重转录模式,满足不同需求

  • 逐字模式:精确记录说话内容,包括填充词、重复、口吃和 vocal 事件,例如:[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]
  • 预期模式:生成清晰易读的版本,自动格式化数字、日期和电子邮件等内容,例如:So we need to reschedule the Thursday meeting to March 3 at 9:30.

⏱️ 精准的词级时间戳

提供平均约30毫秒的词边界误差(朗读语音)和41毫秒(会话语音),是目前基准测试中最精确的词级时间戳系统。

🌍 多语言支持

支持多种语言的逐字和预期模式转录,在Nyra Verbatim Speech Benchmark基准测试中,跨十种语言的不流畅F1得分领先于所有测试的闭源替代方案。

🚀 生产级推理

采用CTranslate2运行时,结合推测解码技术,并内置缓解Whisper循环幻觉故障模式的机制,确保稳定高效的语音识别体验。

📊 性能对比

在Nyra Verbatim Speech Benchmark基准测试中,CrisperWhisper2.0_large表现出色:

#SystemDisfluency F1
1CrisperWhisper 2.0 Pro93.5
2CrisperWhisper 2.087.8
3ElevenLabs Scribe v279.2
4Microsoft MAI-Transcribe-1.577.5
5CrisperWhisper 1.0*64.8

*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成逐字集。

在词定时准确性方面,CrisperWhisper2.0_large同样领先:

#SystemBoundary error
1CrisperWhisper 2.029.6 ms
2xAI Grok Speech-to-Text37.1 ms
3CTC-seg49.3 ms
4ElevenLabs Scribe v251.3 ms
5NeMo-FA60.0 ms

📥 快速安装步骤

NVIDIA GPU(Linux)安装

这是最快的安装方式,包含推测解码功能。只需安装NVIDIA驱动,CUDA库将通过pip自动安装:

pip install "crisperwhisper[ct2]"

纯PyTorch安装

可在任何支持torch的环境(macOS、Windows、CPU)上运行:

pip install "crisperwhisper[transformers]"

🚀 3分钟快速上手

基本转录

from crisperwhisper import CrisperWhisperModel # 加载模型(默认加载nyralabs/CrisperWhisper2.0_large) model = CrisperWhisperModel() # 也可选择不同大小的模型:CrisperWhisperModel("turbo") # turbo / medium / small # 逐字转录(默认模式):包含所有填充词、重复、口吃和vocal事件 result = model.transcribe("meeting.wav", language="en") print(result.text) # 预期模式:生成清晰易读的版本 clean = model.transcribe("meeting.wav", language="en", mode="intended")

获取词级时间戳

# 获取词级时间戳 result = model.transcribe("meeting.wav", language="en", word_timestamps=True) for w in result.words: print(f"{w.start:6.2f}-{w.end:6.2f} {w.word}")

升级现有转录文本

# Verbatimize:将现有干净转录文本升级,添加音频中实际存在的不流畅表达 result = model.verbatimize("clip.wav", "I think we should ship it Friday.")

更快的推理:推测解码(ct2)

使用小型草稿模型提出标记,主模型进行验证,输出相同但速度提升1.3至1.4倍:

model = CrisperWhisperModel("large", draft_model="turbo") result = model.transcribe("meeting.wav", language="en", speculative_decoding=True)

🧩 可用模型

ShorthandHuggingFace IDNotes
"large" (default)nyralabs/CrisperWhisper2.0_large最佳开放质量
"turbo"nyralabs/CrisperWhisper2.0_turbo最快,质量略有下降;推荐作为推测草稿
"medium"nyralabs/CrisperWhisper2.0_medium接近large质量;尺寸和质量之间的最佳权衡
"small"nyralabs/CrisperWhisper2.0_small最小型
"large_pro" / "turbo_pro" / "medium_pro" / "small_pro"nyralabs/CrisperWhisper2.0_ _proPro:我们最好的模型,性能提升,热词增强,在额外专有数据上训练

标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅可通过商业许可获得。

📦 其他功能

CrisperWhisper2.0_large还提供以下实用功能:

OptionWhat it does
mode="verbatim" / "intended"每次调用选择"所说内容"与"所指内容"
word_timestamps=True通过监督交叉注意力对齐获得每个词的开始/结束时间
hotwords=[...]偏向识别名称和罕见术语(仅Pro模型)
model.transcribe_dual(...)一次传递中获得逐字和预期版本(ct2)
model.verbatimize(audio, transcript)将真实的不流畅表达插入可信的干净转录文本
model.forced_align(audio, text)为已有转录文本生成时间戳
Longform超过30秒的音频通过条件延续无缝转录,无块边界重复、丢失或拼接问题
Hallucination mitigation默认开启:在解码过程中检测并抑制Whisper的循环重复故障模式
compute_type="float16" / "int8_float16"量化

📜 许可证信息

CrisperWhisper 2.0根据组件的不同分布在两个单独的许可证下:

ComponentLicense
Software— 推理代码、预处理和后处理代码以及脚本MIT License— 宽松,包括商业使用
Model— 模型权重、检查点、参数、配置文件、分词器/词汇表 —以及模型生成的任何输出nyra health Non-Commercial Research License— 仅非商业使用

简而言之:推理代码和其他软件采用MIT许可,可用于任何目的,包括商业用途。只有模型权重及其生成的输出被许可用于非商业用途;任何商业使用模型权重或输出都需要获得nyra health GmbH的单独商业许可。

📚 相关资源

  • 完整文档
  • 发布文章
  • 论文
  • 模型
  • 基准测试
  • 基准测试仓库

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/31 21:33:00

3分钟免费解锁付费墙:13ft Ladder自托管工具完整指南

3分钟免费解锁付费墙:13ft Ladder自托管工具完整指南 【免费下载链接】13ft My own custom 12ft.io replacement 项目地址: https://gitcode.com/GitHub_Trending/13/13ft 还在为付费墙阻挡阅读而烦恼吗?13ft Ladder是一款完全免费、自托管的付费…

作者头像 李华
网站建设 2026/7/31 21:27:41

Redis 月度运维日志:向量搜索服务的监控数据、告警处理和优化记录

Redis 月度运维日志:向量搜索服务的监控数据、告警处理和优化记录 一、深度引言与场景痛点 7 月我们的 RAG 系统从测试环境搬到生产,Redis Stack 的向量搜索模块(RediSearch)扛起了日均 50 万次向量检索的流量。第一周风平浪静&…

作者头像 李华
网站建设 2026/7/31 21:27:34

月度检索技术前沿速递:7 月向量检索领域的重要突破和技术趋势

月度检索技术前沿速递:7 月向量检索领域的重要突破和技术趋势 一、深度引言与场景痛点 7 月是向量检索领域的"大月"——多篇重磅论文发布、Milvus 2.5 正式上线、Qdrant 推出了新的量化方案,就连 Redis Stack 的 RediSearch 也更新了 HNSW 算…

作者头像 李华
网站建设 2026/7/31 21:25:54

如何使用Landsat-util快速获取高分辨率卫星影像?5分钟上手教程

如何使用Landsat-util快速获取高分辨率卫星影像?5分钟上手教程 【免费下载链接】landsat-util A utility to search, download and process Landsat 8 satellite imagery 项目地址: https://gitcode.com/gh_mirrors/la/landsat-util Landsat-util是一款功能强…

作者头像 李华