Buzz 离线语音转录工具:本地 Whisper 音频转字幕上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
整理会议录音时,用 Buzz 这款离线语音转录工具可以把音频直接在本机转成文字,文件不上传任何服务器。它基于 OpenAI Whisper,支持离线语音转文字与音频转字幕,免费运行,适合敏感会议、视频字幕和实时展示三类场景。
功能速览
| 项目 | 说明 |
|---|---|
| 运行方式 | 完全本地推理,音频不出本机(可选 OpenAI API 后端,需联网) |
| 核心能力 | 文件转写/翻译、麦克风实时录制、说话人识别、导出 TXT/SRT/VTT |
| 支持平台 | Windows、macOS、Linux(Flatpak/Snap/PyPI) |
| 适用人群 | 会议录音整理、视频字幕、实时演示字幕、研究批量转写 |
本地引擎的实现集中在 buzz/transcriber/ 目录,想验证它的离线能力,可以从这个目录读起。
安装与首次运行
各平台最短安装路径
- Windows:从官方发布渠道下载安装包,程序未签名,安装时出现安全提示需选择"更多信息 → 仍要运行"
- macOS:下载
.dmg安装 - Linux:Flatpak 或 Snap 均可一键安装
- 源码方式:需 Python 3.12 环境并装好 ffmpeg
pip install buzz-captions python -m buzz需要最新开发版本时,可通过 git clone 获取源码(仓库地址:https://gitcode.com/GitHub_Trending/buz/buzz )再按说明从源码运行。
首次配置建议两条
- 模型大小按任务取舍。项目定义了 tiny、base、small、medium、large 五档(
buzz/model_loader.py中的WhisperModelSize枚举),日常快速转写用 tiny 或 base 即可,追求准确率再上 large,推理时长和内存占用会明显增加。 - 按显卡开硬件加速。Nvidia 走 CUDA,Mac 默认优化 Apple Silicon,集显可走 Whisper.cpp 加 Vulkan,在偏好设置的模型选项里选择即可。
核心能力拆解
完全离线推理
所有推理在本地机器执行,音频文件只在本地被读取,全程无上传环节。对会议、访谈这类有数据合规要求的材料,这是选择它的最直接理由。GPU 环境检测逻辑见buzz/cuda_setup.py,可从这里理解本地推理链路。
多引擎与硬件加速
后端覆盖 Faster-Whisper、Whisper.cpp、Hugging Face 模型三类本地方案,外加可选的 OpenAI API。佐证是 CLI 的--model-type配置项,允许值含 whisper、whispercpp、huggingface、fasterwhisper、openaiapi 五种。加速方面,CUDA、Apple Silicon、Vulkan 均有明确支持,Vulkan 覆盖多数显卡包括集显,没有独显的机器也能提速。
多语言界面与转写
界面自带 15 种语言的资源包,简体中文在列,切换看偏好设置里的语言选项即可。转写侧支持多语言识别,语言项留空时自动检测,中英文混合内容不必手动指定。
三个真实工作流
场景 A:直播讲解实时字幕
- 输入:麦克风现场音频,语言设为自动检测
- 操作:点击录制按钮,选 small 档位的模型压低延迟
- 操作:打开独立演示窗口,投屏到外接显示
- 产出:当前语言转录文本,活动结束后导出 TXT 存档
独立窗口实现位于buzz/widgets/presentation_window.py,这是演示场景的关键组件。
场景 B:批量会议录音整理
- 输入:一批 mp3、m4a 会议录音
- 操作:拖入文件批量建任务,分别指定转写或翻译
- 操作:任务队列在后台顺序执行,期间可以关窗继续别的工作
- 产出:输出目录下的 TXT/SRT/VTT 文件,段落带时间戳
场景 C:教程视频配字幕
- 输入:mp4 视频文件
- 操作:转写完成后打开查看器,逐段修正起止时间
- 操作:用段落调整工具合并或拆分段落,适配单行字幕长度
- 产出:标准 SRT 文件,直接导入剪辑软件
实测下来,场景 C 的第三步最花时间,建议把时间轴微调放在查看器里一次性做完,而不是导出后再手工改。
进阶玩法
📁 文件夹监控
- 适合谁:经常把大量音视频丢进固定目录的人
- 怎么做:在偏好设置开启监控并指定输入目录,新出现的媒体文件自动进队列。监听逻辑与支持扩展名清单见
buzz/widgets/transcription_task_folder_watcher.py,覆盖 mp3、wav、mp4、mkv 等常见格式 - 注意什么:监控会持续触发任务,低配机器建议搭配小模型,避免大模型连续排队拖垮整机
⌨️ CLI 批量处理
- 适合谁:脚本化、自动化用户
- 怎么做:
buzz/cli.py提供 --task、--model-type、--model-size、--output-directory 等参数,配合 --srt/--vtt/--txt 选输出格式,加 --hide-gui 即可无界面运行 - 注意什么:不指定 --model-size 时默认 tiny,批量前先把输出格式参数核对一遍,避免整批返工
🏷️ 导出文件名模板
- 适合谁:需要区分大量输出文件的用户
- 怎么做:在偏好设置的"Default export file name"中编辑模板,支持
{{ input_file_name }}、{{ task }}、{{ date_time }}等变量,默认形如{{ input_file_name }} ({{ task }}d on {{ date_time }}) - 注意什么:变量渲染后不要出现路径非法字符,否则导出目录会混乱
常见坑与解法
- 长音频内存占用高:大模型加长段落会同时吃显存和内存。处理超长文件时换 Whisper.cpp 后端,或先切分音频,或降低模型档位。
- 实时转录延迟明显:通常是模型过大或在 CPU 上跑。直播场景用 small 或 base,并确认 CUDA 或 Vulkan 已生效。
- 专业术语识别率低:模型依赖通用语言习惯。把领域词汇写进初始提示词(入口在
buzz/widgets/transcriber/initial_prompt_text_edit.py),再配合较大模型,效果通常有改善。 - 首次运行很慢:模型文件需要在首次使用时下载。先预下载常用模型,网络不稳定的机器建议提前在好网络下备好。
- Windows 安装提示安全警告:官方安装包未签名。选择"更多信息 → 仍要运行",不要误判为病毒。
适合谁,不适合谁
Buzz 适合处理敏感音频(会议、访谈、医疗法务材料)且要求数据自主的人群,也适合需要本地批量产出字幕的视频创作者。要诚实说明局限:推理速度和准确率受硬件约束,动辄数百小时体量的批量转写,云端方案通常更划算;OpenAI API 后端会打破完全离线的定位,使用时留意。命令参数与用法细节见官方文档 CLI 章节,代码与翻译贡献的入口见仓库根目录的 CONTRIBUTING.md。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考