Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款开源的离线语音转文字应用,它在你自己的电脑上调用 OpenAI 的 Whisper 模型(一个把语音转成文字的深度学习模型)完成音频转录和翻译,全程不需要把录音上传到任何服务器。它适合两类人:一是手里有大量会议、课程、采访录音,需要批量转成文字或字幕的人;二是处理内容敏感、绝不能联网上传的隐私场景。本教程从确认电脑能不能跑,到安装、第一次转录、调模型提速,再到排错,一条线讲完。
📋 先确认:Buzz 适不适合你的场景
选型前先看结论,避免装完才发现用不上:
| 你的情况 | 结论 | 说明 |
|---|---|---|
| 音频必须留在本机或内网 | ✅ 正合适 | 转录在本地完成,模型下载后即可离线工作 |
| 会议录音、课程、播客批量转文字 | ✅ 正合适 | 支持队列任务、文件夹监控自动转录 |
| 给视频做 SRT / VTT 字幕 | ✅ 正合适 | 转录结果可直接导出字幕格式,还能按词重新切分 |
| 想要"秒级"跟读式的实时转录 | ⚠️ 有门槛 | 实时录音比较吃资源,需要用 Whisper.cpp 后端加小模型,硬件弱会追不上 |
| 只有老旧笔记本(不支持 AVX2 指令集) | ❌ 跑不了 | Buzz 依赖 AVX2,太老的 CPU 直接排除 |
| 完全离线的内网机器 | ⚠️ 可以但要准备 | 模型文件要先在联网机器下载好,再拷贝过去(见离线准备脚本) |
系统要求不苛刻:Windows 10+、macOS(Intel 与 Apple Silicon 均可)、主流 Linux 发行版;普通双核 CPU 能跑小模型,8GB 内存以上体验更稳。模型文件的位置是固定的,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache,macOS 在~/Library/Caches/Buzz,Linux 在~/.cache/Buzz,管理空间时心里有数。
🚀 装好并跑起来:三个平台各一条推荐路线
每个平台只走一条最省事的路,装完启动看到主界面就算成功。
Windows:从官方发布页下载.exe安装文件直接安装。应用没有做代码签名,安装时系统会弹安全警告,点"更多信息"再选"仍要运行"即可,这不是中病毒。安装包自带 CUDA 12 支持,N 卡用户无需额外配置。
macOS:下载.dmg后拖进"应用程序"文件夹,Apple Silicon 和 Intel 版都有。
Linux:一条 Flatpak 命令:
flatpak install flathub io.github.chidiwilliams.Buzz备选路线(一行流):Linux 也可以sudo snap install buzz(需先装libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module三个依赖,并执行sudo snap connect buzz:password-manager-service);或者用 Python 3.12 环境执行pip install buzz-captions后运行python -m buzz(需自行装好 ffmpeg)。
验证是否装好:打开 Buzz 能看到任务列表界面,点工具栏的 "+" 图标能弹出文件选择框,录音按钮能点亮,就说明环境没问题。
🎧 第一次使用:把一个音频文件变成文字
目标只有一个:导入一个音频文件,拿到文字。
- 点菜单File → Import Media File(或工具栏 "+" 图标,快捷键 Ctrl/Cmd + O),选中你的音频或视频文件——注意 Buzz 也能直接粘贴视频链接导入,视频里的音轨同样可以转。
- 任务栏里选择Transcribe(转写);语言手动选一个,比自动检测稳得多,官方文档明确建议别依赖自动检测。
- 模型先用 Whisper.cpp 的 small 起步,够快也不至于错得离谱。
- 点Run,进度列会显示百分比,状态变成 Completed 即完成。
- 双击这一行,打开转录查看器,每段文字都带开始/结束时间戳,底部有播放器可以边听边改。
- 在查看器里改完错字,用 Export 菜单导出 TXT、SRT 或 VTT。
导入时点 "Advanced..." 还能看到几个实用开关:Word-Level Timings(按词生成时间戳,为之后切字幕做准备)、Extract speech(先把人声从背景音里抽出来再转,嘈杂音频可用)、以及Initial prompt(初始提示词,把容易拼错的专有名词、术语写进去,能显著减少错字)。
⚙️ 选模型与调速度:先定后端,再定档位
"转得太慢"和"错得太离谱"都出在模型选择上。Buzz 里其实有两层选择:先用哪个后端(怎么跑),再用哪个大小的模型(跑多大)。
后端怎么挑:
| 你的硬件 | 后端选择 | 理由 |
|---|---|---|
| 没有独显 / 集显 | Whisper.cpp | 基于 Vulkan 加速,任何显卡都能用,纯 CPU 也能跑;Mac 上它是最佳选择 |
| N 卡,显存 ≥ 6GB | Faster Whisper | 比原版 Whisper 快一个数量级,吃显存 |
| 内存充裕、追求原始精度 | Whisper(原版) | 准确但慢、吃内存 |
| 想用特定语言的定制模型 | HuggingFace | 支持 MMS(覆盖上千种语言)等第三方模型家族 |
| 本地硬件弱到转不动 | OpenAI API | 放到远端算,需配置 API Key,要联网 |
模型档位怎么挑:
| 档位 | 参数量级 | 定位 |
|---|---|---|
| tiny / base | 约 39M / 74M | 实时录音、快速过一遍,错字多 |
| small | 约 244M | 日常主力,速度和准确率的平衡点 |
| medium | 约 769M | 长音频、要求高的内容 |
| large-v3 / large-v3-turbo | 约 1.5B | 最准;v3 偶尔会"幻听"出没说的词,turbo 版主打速度精度平衡 |
官方 FAQ 的建议很实在:各档位之间没有标准答案,用你自己的语言各试一遍最靠谱。模型在Help → Preferences → Models页下载,下完还能点 "Show file location" 找到文件。Whisper.cpp 还支持量化版(如 q_5)和自定义模型 URL,省显存、可换多语言模型。
提速的关键调节项(多数在 Preferences 里,高级项通过环境变量设置):
- BUZZ_WHISPERCPP_N_THREADS:Whisper.cpp 线程数,默认是 CPU 核心数的一半;16 线程的笔记本设成 8 反而快约 15%,设太高线程合并开销会拖慢速度。
- BUZZ_FORCE_CPU=true:显卡驱动有坑时强制走 CPU。
- BUZZ_REDUCE_GPU_MEMORY=true:用 8 位量化压缩模型,省显存。
- BUZZ_MODEL_ROOT:把模型目录指到大磁盘上。
- HF_ENDPOINT:模型下载慢时,设成
https://hf-mirror.com换镜像加速。
PyPI 安装的用户要 GPU 加速需手动装 CUDA 版 PyTorch(两条核心命令):
pip3 install -U torch==2.8.0+cu129 torchaudio==2.8.0+cu129 --index-url https://download.pytorch.org/whl/cu129 pip3 install nvidia-cublas-cu12==12.9.1.4 nvidia-cuda-cupti-cu12==12.9.79 nvidia-cuda-runtime-cu12==12.9.79 --extra-index-url https://pypi.nvidia.comLinux 的 N 卡开箱即用,Windows 安装包已内置。显卡太老反而拖慢速度时,用BUZZ_FORCE_CPU=true退回 CPU 通常更快。
🧰 进阶玩法:实时录音、翻译、批量与命令行
实时录音:点工具栏的麦克风图标,选好麦克风、任务、语言就开录。官方提醒:默认 Whisper 后端做实时转录很吃资源,建议切到 Whisper.cpp 并用小模型。录音开始后会出现Presentation window(演示窗口)选项,适合讲座、会议场景投屏展示实时字幕。要录电脑里播放的声音(而不是麦克风),需要配一个虚拟声卡,macOS 用 BlackHole、Windows 用 VB CABLE,把系统输出接到虚拟设备后,在 Buzz 里选它当麦克风即可。
翻译:分两种。Transcribe 之外的默认翻译任务走 Whisper 自带的"译成英语"能力,纯离线;译成英语以外的语言则需要 AI 翻译——在 Preferences 里填一个 OpenAI 兼容 API 的 Key 和地址(也支持 Ollama、LM Studio 这类本地部署),给 AI 一段明确的翻译指令即可。开启实时转录导出后,文字会边生成边写进 txt 文件(译文是.translated.txt),方便接 OBS 等工具。官方给的参考成本:约 1 美元可翻译 1 小时音频。
批量与自动:任务列表本身就是队列,导入一堆文件会依次排队转录。更省事的是Folder Watch(Preferences 里的选项卡):指定一个文件夹,新丢进去的音频自动进转录队列。
插件(1.4.5 起):Help → Plugins 里开关、拖拽排序、按 URL 添加社区插件。内置的几个很实用:AI Summary(调 API 生成摘要存进备注)、Export to DOCX(导出 Word)、Resize Transcript(自动把按词的转录合并成字幕段)、DeepFilterNet 降噪(转前先消噪)、Skip Already Transcribed(重导同一文件夹时跳过已转过的文件)。插件机制的源码在 buzz/plugins/,照着写自己的不难。
命令行:Buzz 自带 CLI,可写进脚本做自动化,完整参数见 docs/docs/cli.md。最高频的一条:
# 转录一个 MP3,同时导出 TXT 和 SRT buzz add -m whispercpp -s small -l zh --txt --srt input.mp3-t translate可切换成翻译任务,--model-type还能选 fasterwhisper、huggingface、openaiapi 等后端。
🛠️ 排错:常见问题对照表
| 症状 | 处理办法 |
|---|---|
| 转录太慢 | 换更小模型或换 Whisper.cpp 后端;显存 ≥6GB 的 N 卡上改 Faster Whisper;有更强的机器就用更大的模型 |
| 启动崩溃 | 多半是模型文件下载不完整——在 Preferences → Models 删掉重下;再不行看日志(Help → About Buzz → Show logs),并注意 CPU 是否支持 AVX2 |
录音报Unanticipated host error [PaErrorCode-9999] | 系统层面禁止了麦克风访问。Windows 到 设置 → 隐私 → 麦克风 里给应用开权限,并临时排查杀毒软件 |
| 内网无网机器怎么用 | 在联网机器下载模型后,把模型文件夹整体拷到目标机的对应缓存目录(路径见前文),可配合 scripts/download-models.py 批量准备 |
| 实时字幕追不上语速 | 换 tiny/base 模型 + Whisper.cpp,调大 Transcription step(实时录音高级设置里),牺牲一点延迟换负载 |
| Flatpak 版不跟随深色主题 | 安装gnome-themes-extra,把主题复制到~/.themes并给 Flatpak 开访问权限,详见 FAQ |
| 字幕时间戳对不上、一段太长 | 转录时勾 Word-Level Timings,完成后用 Resize 工具按静音间隔和标点重新合并 |
排完这些还解决不了的,去项目仓库提 issue,附上日志文件,维护者响应很快。
结语
Buzz 把"离线语音转文字"这件事拆得很直白:装好、选模型、丢文件,剩下的时间都花在改错字上。想参与项目本身,可以从 docs/ 文档、翻译 locale 语言包 或给 buzz/plugins/ 写一个插件开始。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考