Buzz 离线语音转文字完整指南:如何用 4 步跑出第一个转录结果
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的免费开源语音转文字工具,所有识别都在你自己的电脑上完成,音频不会离开本机,模型下载一次后即可完全离线工作。本文围绕会议纪要、视频字幕、批量转录三个高频场景,讲清完整的使用流程和调优要点。
首次转录最快上手步骤
- 安装。Windows / macOS 下载官方安装包运行即可(应用未签名,弹出警告时确认继续);Linux 一条命令搞定:
flatpak install flathub io.github.chidiwilliams.Buzz也可以直接用 pip 安装,或git clone https://gitcode.com/GitHub_Trending/buz/buzz体验最新功能:
pip install buzz-captions python -m buzzpip 方式需要先装好 ffmpeg 并使用 Python 3.12 环境。
- 导入音频。通过"文件"菜单或工具栏的"+"图标,选择要处理的音频或视频文件。
- 配置任务。任务选"转录",手动指定语言(自动检测只看开头几秒,手动指定明显更稳),选好模型后点击"运行"。
- 查看结果。状态变为"已完成"后双击该行打开查看器,边播放边核对文本,可导出 TXT、SRT、VTT 三种格式。
场景实操:三个高频用法卡片
🎙️ 会议实时纪要
适用场景:线下会议、访谈、讲座,需要边说边出文字。
关键 3 步:
- 主界面选"录音"任务,指定麦克风,点击"录音";
- 显示模式选"追加并校正",会持续修正上一句的识别错误,效果最接近人工记录;
- 在设置中开启录音转录导出,文字实时写入 TXT 文件,OBS 等直播软件可以直接读取。
产出结果:一份实时更新的文字流,还能打开演示窗口投到大屏上。多人对话可用"识别说话人"功能区分并标注不同发言人。
🎬 视频字幕制作
适用场景:给 MP4、MKV 视频挂字幕,或为剪辑软件准备字幕文件。
关键 3 步:
- 导入视频文件,Buzz 会自动提取音轨;
- 在高级设置里开启"词级时间戳",为每个词生成独立时间戳;
- 在查看器里点击"调整大小",按静音间隔和标点把词合并成标准字幕行。
产出结果:可直接挂载到播放器或剪辑软件的 SRT / VTT 字幕文件。
📦 批量自动转录
适用场景:固定目录持续归档录音,希望全程零操作。
关键 3 步:
- 在设置的"文件夹监视"选项卡中指定一个监视目录;
- 新放入的音频会自动创建转录任务,无需手动导入;
- 重复导入同一批文件时,用"跳过已转录"插件直接复用已有结果,不重跑模型。
批量操作也能一条命令行完成:
buzz add --task transcribe --model-size small --srt --vtt /path/to/audio.mp3--srt和--vtt决定导出字幕格式,--model-size指定模型大小;后面可以跟多个文件一次处理。
产出结果:自动转录 + 规范导出文件,配合脚本可以搭成完全无人值守的工作流。
进阶调优:模型、加速与防错
- ⚡模型大小:草稿用
base或small控制耗时;终稿校对用medium或large换准确率;实时录音建议小模型,保证跟得上语速。 - GPU 加速:后端切到 Whisper.cpp,Nvidia 走 CUDA,AMD / Intel 走 Vulkan;显存不足选量化模型(如
q_5),或在偏好设置中开启 8 位量化。 - 手动指定语言:已知语种就别用自动检测,误识别会明显下降。
- 初始提示:高级设置里填人名、产品名等易错词,纠正专有名词拼写。
- 嘈杂录音:开启"语音提取",或用 DeepFilterNet 插件先降噪再转录。
- 常见排错:速度太慢,换更小模型或用
BUZZ_WHISPERCPP_N_THREADS调整线程数;模型下载慢,把HF_ENDPOINT指向镜像站;旧显卡越跑越慢,设BUZZ_FORCE_CPU=true强制走 CPU。 - 纯离线部署:在有网电脑下载好模型,把模型缓存目录整体拷到离线机器即可,
scripts/download-models.py可帮忙预取模型。
选型参考:Buzz 和同类方案怎么比
| 方案 | 数据隐私 | 联网要求 | 费用 | 实时录音 | 易用性 |
|---|---|---|---|---|---|
| Buzz | 全程本地处理 | 下载模型一次后可完全离线 | 免费开源 | 支持 | 图形界面 + 命令行,新手可直接上手 |
| 云端转录服务 | 音频上传服务器 | 必须联网 | 按量收费 | 支持 | 网页 / API,需要配置密钥 |
| 纯命令行转录工具 | 本地处理 | 离线可用 | 免费 | 不支持 | 仅 CLI,需要终端经验 |
资源收尾
- 官方文档:docs/docs/
- 转录核心模块:buzz/transcriber/
- 插件系统源码:buzz/plugins/
- CLI 用法:docs/docs/cli.md
✅ Buzz 的定位很清晰:一款免费的离线语音转文字工具,音频全程不出本机,图形界面和命令行两种方式都覆盖。对隐私敏感、又不想付转录费的音频工作,它可以在本地一次性解决。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考