Buzz 离线语音转文字:Whisper 本地音频转录,4 步导出字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议结束后,录音文件躺在硬盘里,你要的不是逐句听写,而是带时间戳的文字稿,最好能直接导出成 SRT 字幕。Buzz 是一款离线音频转录工具,基于 OpenAI Whisper,转写与翻译全部在本地电脑完成,音频不上传到任何服务器。它适合处理会议录音、给个人视频配字幕、转录外语播客的人,免费开源,无按量计费。
4 种方式安装 Buzz
Windows:从官方发布页下载安装程序。程序未签名,安装时若弹出安全警告,选择"更多信息"→"仍要运行"即可。
macOS:下载 .dmg 镜像安装,Apple Silicon 芯片可获得原生加速。
Linux:Flatpak 方式最省事:
flatpak install flathub io.github.chidiwilliams.Buzz也可通过 Snap 安装:
sudo snap install buzz。从 PyPI 安装(适合开发者):先装好 ffmpeg 并准备 Python 3.12 环境,然后执行
pip install buzz-captions,用python -m buzz启动。
首次使用:4 步完成一次离线转录
- 点击"导入媒体文件"(快捷键 Ctrl/Cmd+O),支持音频文件,也支持视频文件(自动提取音轨)。
- 为任务选择类型:转写或转写后翻译,再选择音频语言。语言可自动检测,手动指定通常更准。
- 在任务里选择模型大小,点"运行"开始处理。
- 完成后双击任务行,打开转录查看器核对文本与时间戳。
三条主要用法
批量转写已有录音。可以一次导入多个文件,每个文件生成独立任务并行排队;Buzz 还内置"监听文件夹"功能,把目录放进监听列表后,新放入的录音会自动开始转写,适合持续产出内容的场景。需要脚本化时可以改用命令行接口。
🎙️边说边转的实时录音。选择麦克风后点击录音按钮,Buzz 按固定延迟(默认 20 秒)滚动处理音频块,文字在界面中实时累积。演示或授课时可以切换到独立的演示窗口,把实时字幕投到大屏上。
转成文字后再翻译。任务类型选择"转写并翻译",Buzz 先转写出原文,再翻译为目标语言;查看器里可以在原文和译文之间切换对照,适合外语学习材料。若需要更高质量的翻译,还可以接入 OpenAI 兼容的 API 服务。
📦 导出结果与编辑时间码
转写完成后可以从菜单导出 TXT、SRT、VTT 三种格式。SRT 和 VTT 可直接导入视频剪辑软件或播放器作为字幕,TXT 适合做纪要底稿。
转录查看器承担校对工作:左侧文本列表按时间码组织,点击任意一条即可跳转到对应音频位置;播放控制条支持变速、循环播放片段。对不齐的地方可以直接修改某一段的开始/结束时间,也可以拆分或合并相邻片段。多人对话场景下可以开启说话人识别,为不同声音标注发言人。
⚙️ 影响质量与速度的 3 个设置
模型档位。Buzz 提供 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 四种后端,模型大小从 Tiny 到 Large 五档。Tiny/Base 速度快、占用小,适合批量处理;Medium/Large 准确率更高,但需要更大内存。有 NVIDIA 显卡可启用 CUDA 加速,Whisper.cpp 后端支持 Vulkan,集成显卡也能加速。
指定语言。知道音频语言时手动选择,可避免自动检测出错带来的识别偏差,Whisper 共支持 99 种语言。
初始提示。内容里出现大量专有名词、术语时,在高级设置中填一段包含这些词的初始提示,能明显降低错拼。环境侧同样重要:安静环境、离嘴近的麦克风、清晰的发音,对准确率的影响不亚于模型大小。
排障速查
- 转写太慢:换 Tiny 或 Base 模型;NVIDIA 显卡确认 CUDA 已启用;或改用 Whisper.cpp 后端。
- 准确率不够:换更大模型;手动指定语言;为术语添加初始提示;录音环境降噪。
- 支持哪些格式:MP3、WAV、FLAC、OGG 等常见音频,以及 MP4、AVI、MKV 等视频(自动取音轨)。
- 能否批量处理:可以。多文件同时导入、监听文件夹自动处理、命令行三种方式都支持。
技术背景与参与方式
Buzz 用 Python 和 PyQt6 编写,MIT 许可,代码按模块划分:buzz/transcriber/ 实现各后端的转写与录音逻辑,buzz/widgets/ 承载界面组件,buzz/db/ 管理转写历史的本地数据库。项目还有插件系统(AI 摘要、自动字幕切分等),想加新功能或修 bug,可以从 Issues 入手,按贡献指南提 PR。
收尾
Buzz 把"本地、免费、可离线"三件事同时做到:音频不出机器,模型随便切换,导出格式覆盖字幕工作流。如果你不想把录音交给云服务,从安装到第一条字幕,整个过程不超过十分钟。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考