Buzz 本地离线音频转录指南:语音转文字从选型到调优
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的本地离线音频转录工具。音频、视频文件、麦克风实时录音、YouTube 链接都能在自家电脑上完成转录与翻译,覆盖 99 种主流语言,结果可导出为 TXT、SRT、VTT。适合做会议记录的人、做字幕的创作者,以及需要批量把语音转文字的场景。
选型先行:选对模型再动手
Buzz 内置多种 Whisper 后端:标准 Whisper、Faster Whisper、C++ 实现的 Whisper.cpp、Hugging Face 模型,以及 OpenAI API。选型的关键不是"越大越好",而是匹配你的硬件:
| 你的情况 | 推荐模型与后端 | 预期体验 |
|---|---|---|
| 笔记本、无独显、追求速度 | Whisper.cpp + Base | CPU 即可跑,可支撑实时转录 |
| NVIDIA 独显(6GB 以上显存) | Faster Whisper + Medium | 比标准 Whisper 快一个量级,占用内存更少 |
| Mac 用户 | Whisper.cpp + Small/Medium | Mac 上的最佳选择,Apple Silicon 自动加速 |
| 精度优先(采访、讲座、关键材料) | Whisper + Large-V3 | 准确率最高、速度最慢,偶有"幻听"编词 |
| 低延迟会议实时记录 | Whisper.cpp + Tiny | 资源占用最低,响应快 |
两条经验:一是尽量显式指定语言而不是自动检测,官方文档也建议这么做,稳定性更好;二是不确定的话,拿同一段音频跑两个不同档位的模型对比一下,五分钟就能定下来。
安装 Buzz 并产出第一份转录
四种安装方式,按你的平台任选其一:
Windows:下载官方安装包。程序未做签名,安装时出现警告,点"更多信息 → 仍要运行"即可。
macOS:下载.dmg安装器。注意当前版本要求 Apple Silicon,最后一个支持 Intel 芯片的版本是 1.4.5。
Linux:支持 Flatpak、Snap 和 AppImage。
flatpak install flathub io.github.chidiwilliams.Buzz或走 Snap(先装音频依赖):
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzzPython(跨平台):先装好 ffmpeg,并用 Python 3.12 环境:
pip install buzz-captions python -m buzz装完到拿到第一份结果,三步:
- 导入文件:按
Ctrl+O或点左上角"+",选择音频或视频文件,把语言指定为文件实际使用的语言。 - 执行转录:模型选 Base(拿不准就按上面表格来),点 Run。任务在主界面列表里排队,你可以继续做别的事。
- 打开并导出:状态变为 Completed 后,双击该行打开转录查看器,直接导出 TXT、SRT 或 VTT。
各方式的更多细节见安装文档。
三个真实场景的落地打法
会议记录:边开边记,会后修正
输入:会上的麦克风,不需要预先录文件。
操作:选好任务与语言后,按Ctrl+R或点 Record 开始实时转录,文字逐句出现在界面上;要投屏给全场,可打开演示窗口。会后在转录编辑器里把明显错词改掉。
产出:TXT 格式的会议纪要;需要 Word 文档时,用内置的 Export to DOCX 插件一步导出。
视频字幕:词级时间戳 + 字幕重排
输入:一个视频文件,Buzz 直接对其音轨转录。
操作:导入时在选项里勾选 Word-Level Timings(词级时间戳),用 Medium 档模型转录;完成后在编辑器点 Resize,设定单条字幕最大长度、按标点断句。
产出:SRT 或 VTT 字幕文件,可直接导入剪辑软件。
批量处理:文件夹自动进,转录自动出
输入:一个装满音频的文件夹。
操作:在 Preferences 里开启 Folder Watch,指定输入与输出目录,新文件放进去即自动转录;也可以一次性添加多个文件排队。重复导入同一批文件时,开启 Skip Already Transcribed 插件,已出结果的文件会被跳过。想写成脚本的话,CLI 同样支持:buzz add --txt recordings/*.mp3,详见CLI 文档。
产出:每个文件对应一份转录,统一落到你指定的输出目录。
调优速度与准确率:挑 4 个最实用的
GPU 加速。NVIDIA 显卡收益最大:Linux 上 NVIDIA 开箱即用(有问题就装 CUDA 12、cuBLAS、cuDNN);Windows 安装包已内置 GPU 支持;PyPI 安装的版本需要自行安装 CUDA 版 torch。Mac 会自动走 Apple Silicon。Whisper.cpp 另支持 Vulkan,集显也能加速。
初始提示词。把容易听错的人名、术语填进 Initial Prompt(导入表单的 Advanced... 里)。模型会按提示纠正拼写,专名错误明显减少。
语音分离。勾选 Extract speech 后,Buzz 会先把人声从音频中分离出来再转录,对会议通话这类有背景噪音的录音效果突出。
批处理线程数。用 Whisper.cpp 跑批量任务时,可通过环境变量BUZZ_WHISPERCPP_N_THREADS调线程数:官方在 16 线程笔记本上测得设为 8 时提速约 15%,设得更大反而更慢。配合文件夹监控和"跳过已转录",可以挂一夜自动出结果。
更多高级项(如降低显存占用、自定义重排规则)见Preferences 文档。
常见问题
问:完全断网的电脑能不能用?能。先在有网络的机器上把需要的模型下好,再把模型目录复制到离线机器的相同位置:Linux 是~/.cache/Buzz,macOS 是~/Library/Caches/Buzz,Windows 是%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。路径也可以在 Help → Preferences → Models 里点"Show file location"查看,或用仓库自带的模型下载脚本预先备好。
问:实时录音卡顿、句子跟不上怎么办?默认的 Whisper 后端比较吃资源。换成 Whisper.cpp、选 Tiny 或 Base 档,并观察界面上的 Queue 数值:持续增大就加大 Transcription step 或换更小的模型。
问:Buzz 更新后崩溃,先查哪里?多数情况是模型文件不完整或损坏:到 Preferences 的 Models 页删掉对应模型重新下载即可。仍不行就从 Help → About Buzz → Show logs 查日志。另外 CPU 需要支持 AVX2,过老的机器不受支持。
问:转录结果存哪,文件名能自定义吗?默认保存在源文件旁边。在 Preferences → Default export file name 可以设命名模板,支持input_file_name、model_size、date_time等变量,例如{{ input_file_name }} ({{ task }}d on {{ date_time }}),方便按日期归档。
Buzz 的价值一句话:转录链路完全跑在你自己的机器上,文件不出本机,速度和准确率还能按硬件自由取舍。想继续深入,读官方文档。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考