news 2026/9/24 14:12:39

Buzz 本地离线音频转录指南:语音转文字从选型到调优

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 本地离线音频转录指南:语音转文字从选型到调优

Buzz 本地离线音频转录指南:语音转文字从选型到调优

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的本地离线音频转录工具。音频、视频文件、麦克风实时录音、YouTube 链接都能在自家电脑上完成转录与翻译,覆盖 99 种主流语言,结果可导出为 TXT、SRT、VTT。适合做会议记录的人、做字幕的创作者,以及需要批量把语音转文字的场景。

选型先行:选对模型再动手

Buzz 内置多种 Whisper 后端:标准 Whisper、Faster Whisper、C++ 实现的 Whisper.cpp、Hugging Face 模型,以及 OpenAI API。选型的关键不是"越大越好",而是匹配你的硬件:

你的情况推荐模型与后端预期体验
笔记本、无独显、追求速度Whisper.cpp + BaseCPU 即可跑,可支撑实时转录
NVIDIA 独显(6GB 以上显存)Faster Whisper + Medium比标准 Whisper 快一个量级,占用内存更少
Mac 用户Whisper.cpp + Small/MediumMac 上的最佳选择,Apple Silicon 自动加速
精度优先(采访、讲座、关键材料)Whisper + Large-V3准确率最高、速度最慢,偶有"幻听"编词
低延迟会议实时记录Whisper.cpp + Tiny资源占用最低,响应快

两条经验:一是尽量显式指定语言而不是自动检测,官方文档也建议这么做,稳定性更好;二是不确定的话,拿同一段音频跑两个不同档位的模型对比一下,五分钟就能定下来。

安装 Buzz 并产出第一份转录

四种安装方式,按你的平台任选其一:

Windows:下载官方安装包。程序未做签名,安装时出现警告,点"更多信息 → 仍要运行"即可。

macOS:下载.dmg安装器。注意当前版本要求 Apple Silicon,最后一个支持 Intel 芯片的版本是 1.4.5。

Linux:支持 Flatpak、Snap 和 AppImage。

flatpak install flathub io.github.chidiwilliams.Buzz

或走 Snap(先装音频依赖):

sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz

Python(跨平台):先装好 ffmpeg,并用 Python 3.12 环境:

pip install buzz-captions python -m buzz

装完到拿到第一份结果,三步:

  1. 导入文件:按Ctrl+O或点左上角"+",选择音频或视频文件,把语言指定为文件实际使用的语言。
  2. 执行转录:模型选 Base(拿不准就按上面表格来),点 Run。任务在主界面列表里排队,你可以继续做别的事。
  3. 打开并导出:状态变为 Completed 后,双击该行打开转录查看器,直接导出 TXT、SRT 或 VTT。

各方式的更多细节见安装文档。

三个真实场景的落地打法

会议记录:边开边记,会后修正

输入:会上的麦克风,不需要预先录文件。

操作:选好任务与语言后,按Ctrl+R或点 Record 开始实时转录,文字逐句出现在界面上;要投屏给全场,可打开演示窗口。会后在转录编辑器里把明显错词改掉。

产出:TXT 格式的会议纪要;需要 Word 文档时,用内置的 Export to DOCX 插件一步导出。

视频字幕:词级时间戳 + 字幕重排

输入:一个视频文件,Buzz 直接对其音轨转录。

操作:导入时在选项里勾选 Word-Level Timings(词级时间戳),用 Medium 档模型转录;完成后在编辑器点 Resize,设定单条字幕最大长度、按标点断句。

产出:SRT 或 VTT 字幕文件,可直接导入剪辑软件。

批量处理:文件夹自动进,转录自动出

输入:一个装满音频的文件夹。

操作:在 Preferences 里开启 Folder Watch,指定输入与输出目录,新文件放进去即自动转录;也可以一次性添加多个文件排队。重复导入同一批文件时,开启 Skip Already Transcribed 插件,已出结果的文件会被跳过。想写成脚本的话,CLI 同样支持:buzz add --txt recordings/*.mp3,详见CLI 文档。

产出:每个文件对应一份转录,统一落到你指定的输出目录。

调优速度与准确率:挑 4 个最实用的

GPU 加速。NVIDIA 显卡收益最大:Linux 上 NVIDIA 开箱即用(有问题就装 CUDA 12、cuBLAS、cuDNN);Windows 安装包已内置 GPU 支持;PyPI 安装的版本需要自行安装 CUDA 版 torch。Mac 会自动走 Apple Silicon。Whisper.cpp 另支持 Vulkan,集显也能加速。

初始提示词。把容易听错的人名、术语填进 Initial Prompt(导入表单的 Advanced... 里)。模型会按提示纠正拼写,专名错误明显减少。

语音分离。勾选 Extract speech 后,Buzz 会先把人声从音频中分离出来再转录,对会议通话这类有背景噪音的录音效果突出。

批处理线程数。用 Whisper.cpp 跑批量任务时,可通过环境变量BUZZ_WHISPERCPP_N_THREADS调线程数:官方在 16 线程笔记本上测得设为 8 时提速约 15%,设得更大反而更慢。配合文件夹监控和"跳过已转录",可以挂一夜自动出结果。

更多高级项(如降低显存占用、自定义重排规则)见Preferences 文档。

常见问题

问:完全断网的电脑能不能用?能。先在有网络的机器上把需要的模型下好,再把模型目录复制到离线机器的相同位置:Linux 是~/.cache/Buzz,macOS 是~/Library/Caches/Buzz,Windows 是%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。路径也可以在 Help → Preferences → Models 里点"Show file location"查看,或用仓库自带的模型下载脚本预先备好。

问:实时录音卡顿、句子跟不上怎么办?默认的 Whisper 后端比较吃资源。换成 Whisper.cpp、选 Tiny 或 Base 档,并观察界面上的 Queue 数值:持续增大就加大 Transcription step 或换更小的模型。

问:Buzz 更新后崩溃,先查哪里?多数情况是模型文件不完整或损坏:到 Preferences 的 Models 页删掉对应模型重新下载即可。仍不行就从 Help → About Buzz → Show logs 查日志。另外 CPU 需要支持 AVX2,过老的机器不受支持。

问:转录结果存哪,文件名能自定义吗?默认保存在源文件旁边。在 Preferences → Default export file name 可以设命名模板,支持input_file_namemodel_sizedate_time等变量,例如{{ input_file_name }} ({{ task }}d on {{ date_time }}),方便按日期归档。

Buzz 的价值一句话:转录链路完全跑在你自己的机器上,文件不出本机,速度和准确率还能按硬件自由取舍。想继续深入,读官方文档。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 14:11:52

【Coze】【视频】育儿书籍工作流

今天为大家演示一个育儿主题的 Coze 视频自动化工作流。本工作流围绕“育儿书籍”内容展开,结合大语言模型生成文案、AI 分镜脚本设计、图像生成、语音合成和自动字幕,最终输出一条适用于短视频平台的育儿教育视频。整个流程通过多个智能节点自动协作,形成从输入到成片的完整…

作者头像 李华