把声音变成可编辑文字:Buzz 离线语音转文字 15 分钟上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
把 MP3 拖进 Buzz 的导入窗口,选好 base 模型,点 Run,一两分钟后双击任务,逐句带时间戳的文字就躺在查看器里。Buzz(Buzz 离线语音转文字工具)解决的就是这件事:在你自己的电脑上完成本地 Whisper 转录,不上传、不限时长、断网也能转。
项目定位:Buzz 是什么
- 技术底座:OpenAI 的 Whisper 模型(开源的多语言语音识别模型,一次覆盖 90 多种语言),另支持 Whisper.cpp、Faster Whisper、Hugging Face 等多家实现;
- 部署形态:Windows / macOS / Linux 的图形界面安装包,外加一个 CLI(命令行)入口,处理全程在本机完成;
- 适合谁:需要整理会议录音、课程音频、外语素材的普通用户;不适合追求云端并发、不想管理模型文件的团队。
安装与首次出稿
装好它:Buzz 安装步骤
| 系统 | 方式 | 一条命令 |
|---|---|---|
| Windows | winget | winget install ChidiWilliams.Buzz |
| macOS | Homebrew | brew install --cask buzz |
| Linux | Flatpak 或 Snap | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
| 任意系统 | PyPI | pip install buzz-captions && python -m buzz |
Windows 安装包未做代码签名,安装时弹出安全提示属正常现象,点"更多信息"→"仍要运行"即可继续。
跑出第一段文字:首次转录 5 步
- 点菜单"文件 → 导入媒体文件"(
Ctrl+O),选中 MP3、WAV、MP4 等文件。 - 在导入表单里设置三个关键参数:Task选 Transcribe(同语言转录);Language手动选中文
zh而不是自动检测——手动指定能明显提升准确率;Model选base(快速预览)或small(更准,8GB 内存的笔记本上处理耗时约为音频时长的 2 倍,10 分钟的音频大约 20 分钟)。 - 点 Run,任务进入队列,主界面显示实时进度。
- 等状态变成 Completed,耗时、模型、任务类型都在任务列表里。
- 双击任务行,进入转录查看器,第一份文字稿就出来了。
从"能跑"到"好用":后期处理与导出
转录稿拿到手后,查看器里的三个动作决定它能不能直接用。
查看与校对
左上角按钮切换三种视图:时间戳表格、纯文本、翻译。表格里的文本单元格双击即可修改,改动自动保存。听音对稿离不开这几组快捷键:
Ctrl+P播放/暂停,Ctrl+Shift+P重播当前段;Ctrl+G滚动到当前播放位置;Ctrl+←/Ctrl+→微调当前段开始时间,Ctrl+Shift+←/Ctrl+Shift+→调结束时间;Ctrl+T/Ctrl+E/Ctrl+L分别切到时间戳、纯文本、翻译视图。
重新断句
点工具栏的 Resize 打开字幕重组:按标点拆段、按最大长度(默认 42 字符)截断,把 Whisper 随意切分的长句整理成规整的字幕行。
重组依赖词级时间戳,转录前需要在高级设置里勾选 word-level timings,事后无法补。
导出
点"导出"按钮选择格式,转录文本和译文都能单独导出:
| 格式 | 典型用途 | 适用场景 |
|---|---|---|
| TXT | 纯文本存档 | 放进文档、喂给大模型 |
| SRT | 视频字幕 | 导入剪映、Premiere 等剪辑软件 |
| VTT | Web 字幕 | 网页播放器、B 站上传 |
更多细节可看 docs/ 目录下的使用说明。
场景化玩法:按任务挑场景
边开会边出稿:实时录音转录设置
会议进行中就要出稿?切到 Live Recording 标签页,选麦克风、语言、模型,点 Record,文字边说边出。
关键设置:实时转录必须用 Whisper.cpp 后端 +
base或更小的模型,否则文字跟不上语速;长会议可开启"Append and correct"模式,让模型回头修正刚生成的句子,代价是更吃硬件。演示窗口(Presentation Window)能把实时字幕投到第二块屏,配合"实时转录导出到文本文件"还能把字幕流接进 OBS。
一个文件夹一次转完:CLI 批量
文件一多,逐个点 Run 就慢了,交给命令行:
buzz add --model-type whispercpp --model-size small --language zh \ --prompt "专有名词:张三、项目星云" --srt --vtt *.mp3高频坑:
--prompt里写上人名、产品名等专有名词,错字率会明显下降,这是最便宜的"自定义词典"。
外语素材直接出英文稿:离线翻译
手里只有外语音频、却想直接拿英文稿?两条路:
- 任务类型选 Translate to English,这是 Whisper 自带的能力,全程离线;
- 要任意目标语言(比如中译西),在偏好设置里填一个 OpenAI 兼容接口,指向本地 Ollama 或 LM Studio,再在查看器点 Translate,用一句指令限定"只翻译、不加注释"。
高频坑:Translate to English 只出英文;其他目标语言必须配置翻译接口,别指望离线凭空出现。
把电脑里的声音也转掉:系统音源捕获
要转的"麦克风"其实是屏幕里的声音(播客、在线课程)?用虚拟声卡把系统输出重定向给 Buzz:
- Windows:VB-CABLE,系统输出设为 CABLE Input,Buzz 里选 CABLE Output;
- macOS:BlackHole,在"音频 MIDI 设置"建多输出设备;
- Linux:
pavucontrol里把应用音频重定向到 Buzz。
高频坑:别忘了系统输出还得正常出声——多输出设备里要同时保留扬声器,否则会一边没声音一边转录。
模型与性能:先选对再谈快
模型大小决定速度、准确率和内存占用的平衡:
| 模型 | 速度体感 | 适用场景 | 硬件要求 |
|---|---|---|---|
| tiny / base | 分钟级出稿 | 实时转录、快速预览 | 纯 CPU 即可 |
| small | 约为音频时长 2 倍 | 日常转录的主力 | 8GB 内存起步 |
| medium / large | 小时级 | 口音重、术语密集的专业录音 | 建议 GPU |
| whisper.cpp 量化版 | 接近实时 | 纯 CPU 或老 GPU 机器 | 任意 |
没有 NVIDIA 显卡就选 Whisper.cpp,它在 CPU 上也能实时转录;有显卡时,在偏好设置的模型选项里启用 CUDA(Linux 开箱即用,Windows 安装包内置 CUDA 12,旧版驱动会自动退回 CPU)。GPU 生效后的量级变化很直观:large 模型从小时级降到分钟级。
国内网络下载模型慢,启动前设置环境变量:
HF_ENDPOINT=https://hf-mirror.com。
排错速查
| 症状 | 原因 | 一句话解法 |
|---|---|---|
| 录音报错 PaErrorCode-9999 | 系统拦截了麦克风权限 | 到系统隐私设置里给 Buzz 放行 |
| 转录速度过慢 | 模型太大 | 换 base 或 Whisper.cpp 量化版 |
| Resize 无法重组字幕 | 没生成词级时间戳 | 转录前勾选 word-level timings 重转 |
| 下载模型后卡死或闪退 | 模型文件损坏 | 在偏好设置 → Models 删除重下 |
| 离线机器用不了 | 首次运行需下载模型 | 在联网机器下载后,把模型缓存文件夹拷到同路径(Linux 为~/.cache/Buzz) |
今天就做一件事:导入一个文件,选 base、手动指定语言,点 Run,导出 SRT 看完整条流程。卡在哪一步,去项目仓库提 Issue,附上日志最快。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考