Buzz:免费离线语音转文字完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费开源的离线语音转文字工具,由 OpenAI Whisper 驱动,全部转写在本地完成。音频文件永不离开设备,支持 99+ 种语言与多种规模的 Whisper 模型,适合会议纪要、采访字幕与讲座录音的批量处理。
解决什么问题
处理音频时,大多数人卡在三个地方:
- 隐私:涉及商业机密的会议录音、医疗咨询对话不敢上传云端,而云端转录服务要求整段音频先过服务器。
- 成本与网络:云服务按分钟计费,弱网环境不稳定,中小规模的录音需求还要排队等待。
- 效率:人工整理采访、讲座的字幕极其耗时,一个视频常常要花掉整个下午。
Buzz 的思路是:在个人电脑上离线完成转录与翻译。下载合适的 Whisper 模型后,转写、翻译、字幕导出全部在本地闭环,音频不出设备。
Buzz 安装与首次转录
按平台选择一种安装方式,几分钟即可完成:
# macOS brew install --cask buzz # Linux flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzzWindows 直接运行安装包即可;应用未签名,提示拦截时点"更多信息"→"仍要运行"。开发者也可以用pip install buzz-captions后执行python -m buzz直接跑起来。
第一次转录的流程:
- 把音频或视频文件(MP3、WAV、M4A、OGG、MKV、MP4 等)拖入主界面。
- 选择模型——tiny 最快、large 最准,并手动指定语言避免误判。
- 点击运行,任务完成后双击该任务打开查看器:编辑文本、调整分段时长,再导出为 TXT、SRT 或 VTT。
核心能力拆解
转录引擎本地 transformers / whisper.cpp 后端与 OpenAI 兼容 API 后端并存,同一套任务可在纯离线与自建服务之间切换。支持 99+ 种语言,翻译任务可并行输出,tiny 到 large 的模型可任选,匹配不同硬件。
自动化文件夹监视功能会捕获指定目录的新文件并自动转录,适合固定落盘目录的录音笔。录音转写提供"向下追加""向上追加""追加并校正"三种模式,边播边记、事后统一修订都可以。说话人识别会按音色区分发言者并逐段打上标签。
性能NVIDIA GPU 可走 CUDA 加速,macOS 走 CoreML 路线,量化后的 whisper.cpp 模型进一步压低显存。模型越大精度越高也越慢,按硬件选档是提速的关键。
按角色看怎么用
记者 / 采访者用实时录音转写跟住访谈节奏,文字随发言滚动生成,结束后只需校对措辞。访谈场景选 medium 模型,速度和准确率的平衡最好,开始前手动设好语言。
视频创作者直接导入视频,Buzz 提取音频并生成带时间戳的字幕,导出 SRT 即可进剪辑软件。过长的字幕行可用 resizer 按屏宽拆分,避免遮挡画面。
研究者讲座录音成批处理:批量拖入文件,或让文件夹监视盯着存放目录,机器后台慢慢跑。非英语语料建议手动指定语言,比自动检测更稳。
企业用户把会议录音的落盘目录设为监视目录,散会后纪要草稿自动就位。再配合导出文件命名模板,交付物命名统一,方便归档和共享。
性能调优与常见坑
- 转录太慢→ 换更小的模型、开启 GPU 加速、关闭占内存的后台程序。
- 准确率偏低→ 手动指定语言,安静环境录制;专业术语写进"初始提示"引导模型。
- 格式无法导入→ Buzz 支持 MP3、WAV、M4A、OGG、MKV 等常见音视频格式,冷门格式先转 MP3。
- 长音频中途卡顿→ 检查磁盘与内存余量;大模型跑长音频建议用量化 whisper.cpp 路径。
- Windows 安装被拦截→ 应用未签名属正常现象,点"更多信息"→"仍要运行"。
选型对比
与云端转录服务放在一起看:
| 维度 | Buzz | 云端转录服务 |
|---|---|---|
| 数据位置 | 完全本地,音频不出设备 | 必须上传服务器 |
| 网络 | 离线可用 | 依赖稳定网络 |
| 费用 | 免费,仅一次性下载模型 | 按分钟 / 字数计费 |
| 速度 | 取决于本地硬件 | 取决于服务器负载 |
| 自定义 | 模型、导出模板、插件均可配置 | 受限于固定 API |
相对命令行形式的 whisper 开源工具,Buzz 的差异在于界面与流程:任务队列、可视化查看器、录音模式和插件体系让它对非程序员开箱即用;代价是常驻 GUI 的内存开销,服务端纯批量任务用 CLI 方案更轻。
技术架构速览
buzz/ ├── transcriber/ # 转录引擎 │ ├── file_transcriber.py │ ├── recording_transcriber.py │ └── whisper_cpp.py ├── widgets/ # 界面组件 │ ├── main_window.py │ └── transcription_viewer/ ├── db/ # entity / dao / service └── settings/ # 配置管理三个核心入口:
- 文件转录:buzz/transcriber/file_transcriber.py
- 录音转录:buzz/transcriber/recording_transcriber.py
- 主界面:buzz/widgets/main_window.py
Buzz 把语音转文字的全链路放在本地完成,从单场会议录音到批量归档都覆盖。
git clone https://gitcode.com/GitHub_Trending/buz/buzz使用文档见:官方文档
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考