Buzz 离线音频转录:3 分钟把音频视频变成文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款开源的离线音频转录工具,基于 OpenAI 的 Whisper 语音识别模型,在你自己的电脑上完成本地转录与翻译,音频文件全程不离开你的磁盘。整理会议记录、制作视频字幕、麦克风实时转写,装好即可用,不依赖云服务,也不需要注册任何账号。
它是什么:为什么选择本地转录
在线转录服务通常要求你把文件上传到云端,对企业会议录音、个人语音备忘这类敏感内容来说,这一步本身就存在风险。Buzz 的做法相反:Whisper 模型下载到你本机的缓存目录,推理全部在本地完成,模型就位之后断网也能继续转录,甚至可以git clone https://gitcode.com/GitHub_Trending/buz/buzz拿到源码自行构建。
Buzz 是一个覆盖 macOS、Windows、Linux 的桌面应用,它的差异点不在于"能转文字",而在于几条具体能力:
- 多种 Whisper 后端:Whisper、Faster Whisper、Whisper.cpp、Hugging Face 四套引擎可选,分别支持 Nvidia 显卡 CUDA 加速、Mac Apple Silicon 加速,以及大多数其他显卡的 Vulkan 加速
- 实时转录:从麦克风实时转写会议或讲座,并配有演讲展示窗口,适合现场投屏
- 字幕流水线:导出 TXT、SRT、VTT,配合 Resize 工具调整字幕断行,用说话人识别区分不同发言人
- 插件体系:内置 AI 摘要、DeepFilterNet 降噪、DOCX 导出等插件,见插件文档
转录历史保存在本地数据库中,批量文件还能用监听文件夹功能自动转录。
安装 Buzz 并完成第一次转录
按平台选择安装方式:macOS从官方发布页下载.dmg安装;Windows运行安装程序,因程序未签名会弹出警告,选择"更多信息"→"仍要运行";Linux用flatpak install flathub io.github.chidiwilliams.Buzz最简单,也可以用sudo snap install buzz;开发者先装好 ffmpeg,再执行pip install buzz-captions,然后python -m buzz启动(需 Python 3.12 环境)。更多细节见安装文档。
第一次转录的完整流程:点击工具栏的"Import Media File"(快捷键Ctrl/Cmd + O)导入音频或视频文件,视频会自动提取音轨;在表单里选择任务(Transcribe 或 Translate to English)、语言和模型,官方建议明确指定语言而不是依赖自动检测;点击 Run 开始处理,状态变为 Completed 后双击该行,即可打开转录查看器。模型首次使用会自动下载,之后可随时在Help → Preferences → Models里预下载和管理。
典型使用场景
会议整理者的实时记录。切到 Live Recording 界面,选好任务、语言、模型和麦克风,点 Record 即可看到文字实时出现。官方明确建议:实时转写请用 Whisper.cpp 后端加小模型,默认的 Whisper 引擎对计算资源要求很高。长会推荐Append and correct模式,它会在追加新句子的同时回头修正上一句的错误;需要现场投屏时,打开 Presentation window 即可放大显示实时文本。
视频创作者的字幕批量生产。一次导入多个视频文件,在导出格式中选 SRT 或 VTT;高级设置里勾上 Word-Level Timings 生成词级时间戳后,就能用 Resize 工具 按最大字幕长度、标点切分等规则重新组合断行。若原始音频还在本机,该工具还会分析静音段来校准字幕边界,也可以给每个字幕段统一延长显示时间。
语言学习者的转录加翻译。内置的 Translate to English 任务可以直接把音频译成英文文本;要翻到其他语言,则配置任意 OpenAI 接口兼容的 API(Ollama 这类本地服务也支持),在转录查看器点 Translate,并在 Instructions for AI 里写清目标语言和"不要添加注释"之类的要求。官方给出的参考:用 ChatGPT 或 Claude 级模型翻译 1 小时音频,成本约 1 美元。
档案管理者的说话人区分。打开转录查看器后点 Identify speakers,Buzz 会自动给不同发言人的句子打标签,你能试听任意一句来确认身份,并把标签改成真实姓名;勾选 Merge speaker sentences 后,同一发言人的连续句子会合并为整段。
需要脚本化的话,Buzz 自带 CLI,例如buzz add --task transcribe --model-type whispercpp --model-size small --srt audio.mp4,完整参数见CLI 文档。
调优转录质量与速度
质量与速度主要受模型选择影响。模型大小从 tiny、base、small、medium 到 large 递增:小模型跑得快但错误多,大模型更准但吃硬件。large 系列里 V3 目前准确率最高,但偶有"幻觉"出音频里不存在的词,Turbo 模型则在速度和准确率之间取平衡。官方 FAQ 的选型建议是:Nvidia 显卡显存至少 6GB 用 Faster Whisper(比原版快数量级);没有 Nvidia 卡或在 Mac 上用 Whisper.cpp(集显笔记本乃至纯 CPU 都能跑实时转录);需要特定语言的定制模型走 Hugging Face 通道,它同时支持 MMS 系列上千种语言。详见FAQ。
几个直接影响结果的具体变量:
- 明确指定语言:自动检测只依据开头几秒音频,已知语言时手动选择通常更稳
- Initial prompt:把人名、术语等易拼错的词填进高级设置的初始提示,可明显减少拼写错误
- Extract speech:勾选后先把人声分离到单独音轨再转录,适合噪音较大的音频
- Whisper.cpp 线程数:通过
BUZZ_WHISPERCPP_N_THREADS环境变量调整,官方实测 16 线程笔记本设为 8 约提速 15%,线程再大反而更慢 - 显存/内存不够:Whisper.cpp 可选量化版本(如 q5),或开启
BUZZ_REDUCE_GPU_MEMORY做 8bit 量化
常见问题
没有网络能用吗?可以。先在有网机器上下载好模型,把模型缓存目录(Linux 为~/.cache/Buzz/models)拷到离线机器相同位置即可,仓库还提供 scripts/download-models.py 帮助准备离线模型包。
转录太慢怎么办?换更小的模型或改用 Whisper.cpp 后端;显存 6GB 以上的 Nvidia 显卡切到 Faster Whisper;最后的手段是配置 OpenAI API 走远程处理,但那就不再是离线转录了。
报错 Unanticipated host error [PaErrorCode-9999]?多为系统麦克风权限问题。Windows 检查"设置 → 隐私 → 麦克风"是否允许 Buzz 访问;macOS 在系统设置里授权。
转录时程序崩溃?多为模型下载不完整或损坏,在Help → Preferences → Models删除对应模型重新下载。另注意 Buzz 要求 CPU 支持 AVX2,太老的机器无法运行。
架构一览
源码按模块组织在buzz/下:transcriber/是转录核心与各后端的适配,widgets/是基于 PyQt 的界面组件,db/管理本地数据库(转录历史与分段),settings/、store/负责配置与密钥,plugins/是插件系统(开发说明见 plugins/AGENTS.md)。入口在 main.py,命令行在 buzz/cli.py。
Buzz 把音频数据的控制权完整交还给你:模型在本地跑,转录历史存在本地数据库,导出成什么格式由你决定。想立即上手就执行pip install buzz-captions后运行python -m buzz,想深入阅读则git clone https://gitcode.com/GitHub_Trending/buz/buzz获取源码。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考