本地离线语音转文字:Buzz 三步完成音频转录
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五下午的部门例会刚结束,你手边有一段 40 分钟的录音,需要在明早交出一份文字稿。Buzz 是一款在你个人电脑上运行的开源离线音频转录工具,基于 Whisper(OpenAI 推出的开源语音识别模型)把录音直接转成文字,全程不联网,音频不离开你的机器。
环境准备与首次运行
Buzz 支持 Windows、macOS 和 Linux 三大平台,按你的系统选最短路径安装:
- Windows:下载安装包运行即可。程序未签名,安装时如提示警告,点「更多详细信息 → 仍要运行」。
- macOS:下载
.dmg文件拖入 Applications 文件夹。 - Linux:
flatpak install flathub io.github.chidiwilliams.Buzz首次运行会提示下载语音识别模型,网络好的情况下等待下载完成即可。
接下来完成第一次转录,一共 5 步:
- 点击工具栏的「+」按钮(或按Ctrl+O),你会看到文件选择框,选中音频或视频文件(MP3、WAV、MP4 等)。
- 在右侧任务表单选择语言,语言不确定可留空让 Buzz 自动检测。
- 选择模型类型和大小(新手建议 Whisper.cpp + base 档,见后文选型表)。
- 点击Run,任务列表状态会从「Queued」变为「Completed」。
- 双击已完成的那一行,你会看到带时间轴的文字稿,顶部有播放和搜索控件。
核心能力拆解
按「输入 → 处理 → 输出」的顺序,Buzz 用到的能力基本就是下面几个。
文件与链接导入(输入):除本地音视频文件外,Buzz 1.2.0 起支持直接粘贴 URL 导入在线音频,不用先手动下载。表单里还能勾选Extract speech,把语音从背景音中分离出来单独转录,适合现场噪音较大的录音。
多引擎模型选择(处理):Buzz 内置 Whisper、Whisper.cpp(C++ 优化实现,支持 Vulkan 显卡加速)、Faster Whisper(针对 NVIDIA 显卡优化)以及 Hugging Face 上的第三方模型。没有独显的机器优先选 Whisper.cpp,NVIDIA 显卡显存 6GB 以上可选 Faster Whisper。
实时录音转录(输入):按Ctrl+R打开录音窗口,选择麦克风即可边录边转。适合讲座、采访这类不能重来的场景。注意它吃 CPU,不算严格意义的实时,长录音建议留一台性能不错的机器。
转录结果编辑器(输出):双击任务进入查看器后,左侧音频波形可点击跳转、调整播放速度,右侧文字支持搜索(Ctrl+F)。选中某一段时,用Ctrl+方向键可以按字微调这段文字的起止时间,改完直接生效。
字幕重排(输出):长句字幕直接挂到视频上会挡画面。启用「调整大小」功能后,Buzz 会按标点断句、把间隔过短的片段合并,并限制单条字幕长度,批量产出适合视频的字幕块。
插件扩展(输出):菜单Help → Plugins可管理插件,内置 AI 摘要、导出 Word(.docx)、DeepFilterNet 降噪、跳过已转录文件等。需要批量处理重复导入的文件夹时,「Skip Already Transcribed」插件会自动跳过已有结果的录音。
两个真实工作流示例
场景一:学生把 90 分钟讲座转成笔记
- 课前按Ctrl+R打开录音窗口,选默认麦克风。
- 点Start开始录制,Buzz 边录边出文字。
- 讲座结束点Stop,确认语言选了英文(或对应语言)。
- 双击任务行,在查看器里用Ctrl+F搜索关键词定位重点。
- 导出为 TXT,粘贴进笔记软件补充自己的批注。
预期输出:一份带时间戳的文字稿,重点段落可以直接按时间戳跳回去核对录音。
场景二:播客创作者为视频生成 SRT 字幕
- Ctrl+O导入视频文件,语言选中文,模型选 small 或更大档位。
- 点开表单的Advanced...按钮,在Initial prompt里填入节目里的高频人名、术语,减少错别字。
- 勾选Word-Level Timings(字级时间戳,字幕重排需要),点Run。
- 完成后在任务上启用字幕重排,设置每条字幕的最大长度。
- 从查看器的导出菜单选SRT,直接拖进剪辑软件。
预期输出:一个句读合理、长度统一的.srt字幕文件,不用再手动切分。
排障速查表
| 问题现象 | 可能原因 | 解决方法 |
|---|---|---|
| 转录速度慢到难以接受 | 用了 CPU 跑大模型 | 换 Whisper.cpp 引擎,或把模型降到 base 档 |
录音报错PaErrorCode-9999 | 系统麦克风权限未授予 | Windows 到 设置 → 隐私 → 麦克风 里打开 Buzz 的权限;其他系统检查麦克风被占用或权限设置 |
| 下载完模型后 Buzz 崩溃 | 模型文件下载不完整或损坏 | 在Help → Preferences → Models里删除该模型重新下载 |
| 某语种识别错误特别多 | 模型太小或没指定语言 | 手动选定语言,模型升级到 small 以上再试 |
| 安装后完全无法启动 | CPU 不支持 AVX2 指令集 | 较老的机器不支持,需要换硬件或改用云端方案 |
进阶配置(按需阅读)
只有当你需要批量处理、跑脚本,或者想压榨显卡性能时才需要看这一节。
命令行:Buzz 自带 CLI,一条命令转录并直接导出字幕:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 录音.mp3完整参数用buzz add --help查看,支持--prompt初始提示词、-l语言代码等。
文件夹监控:在Preferences → Folder Watch标签页指定一个目录,放进去的音频会自动排队转录,配合「Skip Already Transcribed」插件做增量处理。
GPU 加速:Linux 下 NVIDIA 显卡开箱即用(依赖 CUDA 12);Windows 安装包已内置 GPU 支持,旧版 CUDA 的机器会自动回退到 CPU。
离线环境:在有网电脑上下载好模型,把模型缓存文件夹(各系统路径见Help → Preferences → Models的「Show file location」)整体拷到目标机器同一位置即可。
选型决策
模型大小的选择只看下表即可,体积指模型文件下载量:
| 模型 | 体积 | 速度 | 精度 | 推荐场景 |
|---|---|---|---|---|
| tiny | 约 75MB | 最快 | 最低 | 快速预览、验证流程 |
| base | 约 142MB | 快 | 中等 | 日常对话、初步转录 |
| small | 约 466MB | 中等 | 较高 | 专业转录、出字幕 |
| medium | 约 1.5GB | 慢 | 高 | 学术整理、重要内容 |
| large | 约 2.9GB | 最慢 | 最高 | 关键内容、多语言混读 |
如果你拿不准,就用Whisper.cpp + base,不够准了再升 small;大模型只在内容真正重要时才值得那个等待时间。
收尾
Buzz 的定位就是本地离线语音转文字:导入音频,得到可编辑、可导出的文字稿,隐私和算力都留在你自己手里。
下一步,打开Ctrl+O导入一段 5 分钟以内的录音,用 base 模型跑通一次完整流程——这是验证你机器配置最快的方式。
更多细节可以看仓库内文档:docs/docs/faq.md、docs/docs/usage/1_file_import.md。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考