免费离线语音转录:Buzz——本地语音识别完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
访谈录音传上去,800MB的文件转了十分钟网断了;会议正开着,云端转录却卡在加载页;更让人犹豫的是,敏感内容一旦上传,就等于放在别人的服务器上。Buzz 是一款基于 OpenAI Whisper 的本地离线语音转录工具,所有识别和翻译都在你自己的电脑上完成,不上传、不联网、不收 API 费用。
Buzz 是什么,为什么选它
一句话:Buzz 是把"音频转文字、转语言"整套流程搬到你本地的离线工具。对比云端语音服务,它省掉的不只是隐私顾虑。
- 隐私可控:音频文件不出设备,敏感会议、患者访谈也能放心处理
- 断网可用:飞机模式、内网环境照常转录
- 零成本:无 API 调用费、无订阅、不按字符计费
- 多引擎:Whisper、Whisper.cpp、Faster-Whisper 多种后端,支持 GPU 加速
- 导出灵活:TXT、SRT、VTT 一键导出,直接进剪辑或分析软件
它支持 99 种语言的转录,还可以顺带把内容翻译成其他语言。
从安装到第一次输出:上手路径
第1步:装对版本
- Windows:下载安装包,安装时若提示"未签名",选"更多信息 → 仍要运行"
- macOS:下载 .dmg 双击安装
- Linux:通过 Flatpak 或 Snap 一键安装
开发者也可以走 PyPI(需要 Python 3.12 和 ffmpeg):
pip install buzz-captions python -m buzz第2步:导入你的第一个音频
打开 Buzz 按 Ctrl+O(macOS 为 Cmd+O),或在左上角点"+",选择任意音视频文件。主界面就是一个任务队列,每个文件一行:
第3步:运行并查看结果
在弹出窗口选模型和语言,点运行。完成后双击任务行打开转录查看器,就能逐段核对、播放、编辑了。
核心能力拆解:从单文件到批量自动化
模块1:多模型引擎——按你的硬件挑引擎
| 模型 | 速度 | 精度 | 硬件要求 |
|---|---|---|---|
| Tiny | ⚡⚡⚡⚡⚡ | ⭐⭐ | 低,适合实时转录 |
| Base | ⚡⚡⚡⚡ | ⭐⭐⭐ | 中 |
| Medium | ⚡⚡⚡ | ⭐⭐⭐⭐ | 高 |
| Large | ⚡⚡ | ⭐⭐⭐⭐⭐ | 非常高 |
小建议:日常用 Base/Medium 就够,实时转录用 Tiny 更跟手。各引擎实现在 buzz/transcriber/。
模块2:实时录音转录——麦克风输入,文字马上出来
直接开麦对会议或讲座做实时转录,还有全屏演示窗口可以投到大屏,边讲边看文稿。适合会议纪要、演讲提词这类场景。
模块3:转录查看器——时间点精确到毫秒
支持全文搜索、定位播放、逐段调整起止时间,还能把字幕行拆分合并:
这是做字幕后期最常用的一块,建议先花两分钟熟悉它的播放控制。
模块4:任务队列与批量自动化——丢完文件就能走
多文件排队处理,状态独立跟踪(排队/进行中/完成/失败);开启文件夹监控后,新丢进目录的音频会自动转录。不想开界面?CLI 文档里有完整的脚本化用法:
buzz add --model-type whispercpp --model-size small --srt lecture.mp3模块5:插件系统——能力可以随需扩展
官方已带 AI 摘要、说话人识别、字幕自动分行等插件,源码在 buzz/plugins/,用到哪个开哪个。
效率进阶:三个实战技巧
技巧1:明确指定语言,避免误判
自动检测偶尔会听前几秒就下结论。已知语言时,在转录选项里直接选,CLI 对应-l参数,准确率提升立竿见影。
技巧2:按硬件配模型和引擎
有 NVIDIA 显卡会自动走 CUDA;Whisper.cpp 支持 Vulkan,核显也能跑。性能吃紧就用 Whisper.cpp 配 small 模型做实时转录,见 buzz/settings/ 的偏好配置。
技巧3:熟记几个快捷键
Ctrl+O 导入、Ctrl+P 播放/暂停、Ctrl+F 搜索、Ctrl+Return 跳下一个命中。完整列表看 buzz/settings/shortcuts.py,还可以按自己的习惯改键。
真实工作流:他们拿它干什么
张教授(语言学研究者):要转录大量访谈录音,伦理要求原始数据不能上传。
- 录音全部本地处理,数据不出电脑
- 一次排队转录数十小时访谈
- 多语言访谈材料可直接转录并翻译
- 导出 SRT 后直接导入质性分析软件
李小姐(视频创作者):每周要给多个视频上字幕。
- 直接从视频文件转录,不用单独导出音频
- 时间轴编辑精确调整字幕出现时机
- SRT/VTT 导出满足不同平台格式要求
- 录完旁白实时转录,当场就有文字稿
王先生(会议记录员):负责全部门会议纪要。
- 会议中实时转录,先出一版初稿
- 演示窗口让参会者同步看到文稿
- 说话人识别区分不同发言者
- 会后只需校对整理一轮
避坑指南:三个常见误区
误区1:模型越大越好
很多人默认选最大模型,但更大意味着更慢、对硬件要求更高,日常对话未必更准。正确做法:按场景选——实时用 Tiny,重要会议用 Medium 或 Large。
误区2:全靠自动检测语言
自动检测对混合语言、口音较重的音频容易判断失误。正确做法:知道语言就手动指定,别省事。
误区3:音频质量无所谓
背景噪音、离麦太远、多人抢话都会拉低准确率。正确做法:尽量安静环境、单人清晰发言,噪音大的可以先用语音分离功能把人声抠出来再转。
今天就打开它
项目更新很勤:最新版本刚修复了翻译问题,AI 摘要、说话人识别等新插件持续加入,CUDA 与 Vulkan 加速覆盖也不断扩大。少一次上传,多一分掌控——今天就打开 Buzz,转录你的第一个音频文件。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考