Buzz离线语音转录完全指南:从音频文件到可编辑字幕的5个步骤
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
花半天手动整理访谈录音,结果发现有二十分钟听错了?Buzz是一款免费开源的离线语音转录工具,基于OpenAI Whisper,在你自己的电脑上完成音频转文字和翻译。音频从不上传,断网也能转录。
这意味着隐私完全由你掌控。处理敏感录音的记者、医生、律师可以安心使用。它支持Windows、macOS和Linux三大平台。
各平台安装Buzz的5个步骤
Windows:从项目发布渠道下载安装包并双击运行。安装时会有安全警告,因为程序未签名。点击"更多信息",再点"仍要运行"即可。
macOS:下载.dmg文件,拖入应用程序文件夹。Intel和Apple Silicon的Mac都支持。
Linux:通过Flatpak安装,只需一条命令:
flatpak install flathub io.github.chidiwilliams.BuzzSnap用户运行sudo snap install buzz也可以。想从pip安装,先装好ffmpeg,再执行pip install buzz-captions。各平台依赖详见安装文档。
三分钟完成第一次音频转文字
安装完成后,按这5步完成你的第一次转录:
- 打开Buzz,按Ctrl+O(macOS为Command+O),或点工具栏的"+"按钮。
- 选择一个音频或视频文件,MP3、WAV等常见格式都可以。
- 选择任务("转录"或"翻译成英语")并指定语言。官方建议明确选语言,自动检测可能不准。
- 选择模型类型和大小,点击"运行"。
- 状态显示"Completed"后,双击该行打开转录结果。
主窗口是一个任务队列,所有转录任务和进度一目了然。每个任务都能单独选择导出格式:TXT、SRT或VTT。
模型大小和类型怎么选
这是用Buzz要做的第一个决定,核心是速度和准确率的取舍。
| 模型大小 | 速度 | 准确率 | 适用场景 |
|---|---|---|---|
| tiny / base | 最快 | 基础到良好 | 快速整理、低配电脑 |
| small | 中等 | 优秀 | 日常会议、采访 |
| medium / large | 慢 | 最高 | 专业转录、高准确率需求 |
除大小外,还有4种Whisper实现可选。有6GB以上显存的N卡用户,推荐Faster Whisper,速度提升明显。没有N卡或Mac用户,推荐Whisper.cpp。它是C++实现,CPU上也能跑得很快,还支持Vulkan加速。
在"帮助 -> 偏好设置 -> 模型"里可以下载新模型,也可以删除不用的模型释放空间。
实时录音:会议演讲现场出文字
Buzz能把麦克风输入实时转成文字,边说边出稿。
它是什么:选麦克风、语言、模型,点"录音",句子会逐句出现在窗口里。
什么时候用:会议、讲座、路演等需要"说到即转"的场合。
怎么配置:💡 实时录音建议用Whisper.cpp,默认的Whisper模型比较吃资源。配置不高就用小模型。录音开始后还能打开"演示窗口",把实时字幕投到屏幕上。
高级偏好里还能设置"转录模式"和"静音阈值"。"追加并修正"模式会自动修正前句错误,但计算量更大,需要更好的硬件。
逐词时间戳合并成字幕
Buzz的转录结果不只是纯文本,还能变成标准字幕。
它是什么:转录查看器支持搜索、播放控制和播放速度调节。双击转录即可进入编辑。
什么时候用:给视频加字幕,或需要把文字对齐回音频时。
怎么配置:导入文件时勾选"逐词时间戳",Buzz会为每个词记录时间。之后点"调整大小"按钮,设置单条字幕最大长度,即可把逐词时间戳合并成完整的字幕行,再导出SRT或VTT。
没开逐词时间戳也能按最大长度重新合并,只是灵活度稍差。
会议录音场景:当天拿到完整纪要
场景挑战:会议长、内容多,希望散会当天就有文字纪要。
推荐参数:Whisper.cpp + small模型,明确指定语言,导出SRT。
操作步骤:
- 在偏好设置里开启文件夹监控,指向会议录音目录,新文件自动转录。
- 转录完成后在查看器中快速浏览校对。
- 导出SRT分发给参会人。
视频字幕场景:逐词时间戳到SRT
场景挑战:给课程视频加字幕,要求字幕行短、断句自然。
推荐参数:Whisper.cpp + base或small,勾选"逐词时间戳",导出SRT。
操作步骤:
- 导入视频文件,勾选"逐词时间戳"后运行。
- 打开转录,点"调整大小"。
- 设置最大字幕长度并启用按标点断开,导出SRT文件。
导出后的SRT可以直接导入视频编辑软件或OBS。
术语多的场景:让Whisper认对名字
场景挑战:访谈里的人名、公司名、专业术语,Whisper容易拼错。
推荐参数:medium或large模型,把术语写进"初始提示"。
操作步骤:
- 导入时点"高级..."打开高级选项。
- 在"Initial prompt"里填入易错词。
- 运行转录,这些词的识别率会明显提升。
没有网络能用Buzz吗
可以。先在有网络的电脑上下载好所需模型,再把模型文件夹复制到离线电脑。各平台的模型都存在用户目录的缓存文件夹,"帮助 -> 偏好设置 -> 模型"里的"显示文件位置"按钮能直接打开它。
转录速度太慢怎么办
换更小的模型,或改用Whisper.cpp实现。有6GB以上显存的N卡用户,直接用Faster Whisper。更多加速建议见常见问题。
Windows安装时提示危险怎么办
安装程序未签名,系统会弹出安全提示。点"更多信息",再点"仍要运行",安装就能继续。
能用命令行批量处理吗
可以,Buzz自带命令行。例如:
buzz add -m whispercpp -s small --srt meeting.mp3这条命令会新建一个转录任务,并自动导出SRT。完整参数见CLI文档。
写在最后
Buzz把整条离线语音转录链路搬进了你自己的电脑:导入、转录、整理字幕,全程不需要上传。如果你手头正有录音要整理,现在下载一份,完成你的第一次转录吧。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考