Buzz 离线转写:从音频文件到 SRT 字幕的 3 步路径
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
手上有会议录音、播客文件想转成文字和字幕时,Buzz 是一个免费、离线的桌面转写工具:它在你的电脑上本地运行 Whisper 模型,完成转写和翻译。适合需要批量处理本地音视频、需要会议实时字幕的人;不适合期望云端 SaaS 或服务器端 API 的团队。它替你省掉的,是把音频上传给第三方、自己拼转写管线(模型下载、格式转换、SRT 导出)的整套活。
先别装:30 秒判断它适不适合你
| 适合 | 别用 |
|---|---|
| 本地音视频批量转写 | 要集成服务端 API |
| 会议、讲座实时字幕 | 只要一两分钟音频的快文本 |
| 断网、隐私敏感环境 | 依赖云端大模型出结果 |
如果两边都命中,优先看"本地处理"是不是硬需求;不是的话,云端方案更省事。
最小路径跑起来
第 1 步:装解码依赖。Buzz 用 ffmpeg 读取音视频,先用你系统的包管理器装上它。
sudo apt-get install -y ffmpeg # Debian/Ubuntu预期结果:ffmpeg -version能输出版本号。
第 2 步:安装并启动。需要 Python 3.12 环境;macOS 和 Windows 也可以直接下官方安装包,不走这一步。
pip install buzz-captions python -m buzz预期结果:打开带任务列表的主窗口,界面左侧是转写队列,右侧是导入和录音入口。
第 3 步:用一条命令转一个文件。仓库自带测试音频,可以直接拿来验证。
buzz add --model-type whispercpp --model-size small --srt testdata/audio-long.mp3预期结果:任务跑完并在音频旁生成字幕文件。完整参数见 CLI 参考。
看到什么算成功:音频旁边出现audio-long.srt,打开是带序号的时间轴字幕行,就算跑通了。
功能逐个拆
模型后端怎么切换
Buzz 内置多个本地推理后端。Whisper.cpp 是 C++ 优化版实现,没有独立显卡的机器选它;Faster Whisper 在带 6GB 以上显存的 Nvidia 显卡上更快。后端、模型尺寸、目标语言可以按任务切换。
buzz add -m whispercpp -s small testdata/whisper-french.mp3实际效果:普通笔记本用 small 或 base 模型就能做接近实时的转写。模型从偏好设置的"模型"页下载和管理,位置也能改。
实时转写与演示窗口
在实时录音面板选好转写任务、语言和麦克风,点 Record,边说话边出文字;录音进行中再打开"演示窗口",会弹出一个只有大字字幕的独立窗口,可以投到活动大屏。
关键配置没有命令行入口,都在面板里:实时模式(追加/修正)、静音阈值在高级偏好里调。实时转写吃资源,优先用 Whisper.cpp 后端配小尺寸模型。
实际效果:会议结束直接拿到全文;演示窗口专给投影用,正文窗口保持干净。
结果导出与插件后处理
转写结果可导出 TXT、SRT、VTT 三种格式;1.4.5 版本起有插件系统,内置 DOCX 导出、AI 摘要、降噪等插件,转写存完自动执行。
关键配置:Help → Plugins里开关和拖拽排序,Add by URL粘贴一个 zip 链接可装社区插件,内置插件源码可以直接当模板看。
实际效果:批量转完直接出一批字幕文件,或让插件顺手把 Word 讲稿也生成出来。
定制边界:配置能改的 vs 必须动代码的
能做到:
- GUI 里改模型后端、尺寸、语言、初始提示词、导出格式
- 用环境变量改线程数、强制 CPU、降低 GPU 显存占用,不用改代码
- 从 .zip 装社区插件,启停和排序都持久保存
做不到:
- 重排 PyQt6 主窗口布局或换视觉风格
- 直接新增导出格式(途径是写插件,属于动代码)
- 改本地数据库结构
改配置即生效的最小示例(调 Whisper.cpp 线程数后重启):
export BUZZ_WHISPERCPP_N_THREADS=8 python -m buzz碰了可能踩坑的文件:buzz/plugins/base.py(插件契约,改动会影响所有插件)和buzz/db/db.py(本地数据库初始化)。
卡点速查
| 现象 | 原因 | 解法 |
|---|---|---|
| 转写太慢 | 模型相对硬件太大 | buzz add -m whispercpp -s small <文件> |
麦克风报PaErrorCode-9999 | 系统拦截了应用访问麦克风 | 系统隐私设置里给 Buzz 开麦克风权限 |
| 启动或下载模型后崩溃 | 模型文件下载不完整 | 在Help → Preferences → Models删掉重下 |
| 模型下载失败或极慢 | 网络访问 Hugging Face 受限 | export HF_ENDPOINT=https://hf-mirror.com |
延伸入口
- CLI 命令参考
- 偏好与环境变量清单
- 插件开发指南
如果你的诉求是音频不出内网,或者要一场不用手写脚本的现场字幕,Buzz 两头都能覆盖,起步成本就是上面 3 条命令。只想先出字幕的话,从"最小路径跑起来"第 1 步开始即可。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考