news 2026/9/20 20:07:05

Buzz 实战指南:免费离线转录,把本地语音转成文字和字幕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 实战指南:免费离线转录,把本地语音转成文字和字幕

Buzz 实战指南:免费离线转录,把本地语音转成文字和字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的离线转录与音频翻译桌面应用。它基于 OpenAI 的 Whisper 模型在你自己的电脑上运行,音频全程本地处理、不上传云端,适合需要把会议录音、视频内容、讲座音频变成文字和字幕的人。

这几个痛点,Buzz 恰好能解

录音涉及敏感内容,不想交给云端。大多数在线转写服务要求你把音频上传到服务器。Buzz 的转录和翻译全部在本地机器上完成,音频文件不出你的电脑。

按分钟计费的转写服务,量大就贵。Buzz 免费、不限时长、不限次数,转一天讲座和一个 30 秒的语音条,成本一样:零。

做字幕要串好几款工具。抽音轨、转写、对时间戳、导出 SRT,传统流程每步都得换工具。Buzz 在一个窗口里走完整个流程,视频文件直接丢进去就能出字幕文件。

现场活动时,字要立刻能看。开会、讲座、访谈时,你可以边录边出字,还能打开演示窗口把实时文字投到大屏上。

机器配置一般,不知道该用哪个模型。它内置 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 四类后端,从只有核显的笔记本到带显卡的台式机都能跑,选错后端也不会卡死。

装起来:安装包、PyPI 与命令行三条路

图形界面:下载安装包,装完就能用

macOS 用户下载 .dmg 安装包(注意现在仅支持 Apple 芯片机型);Windows 用户下载对应的安装文件;Linux 用户直接一条命令装 Flatpak 版:

flatpak install flathub io.github.chidiwilliams.Buzz

完成信号:启动后看到主窗口,中间是一张任务表,包含文件、模型、任务、状态四列。导入一个文件后,这一行会出现在表里,状态列显示 Queued。

从 PyPI 安装:两条命令跑起本地转录

这条路径适合开发者。前提是系统里已装好 ffmpeg,并且使用 Python 3.12 环境:

pip install buzz-captions python -m buzz

完成信号python -m buzz弹出和安装包版本相同的主窗口;或者终端运行buzz --version能打印出版本号。

提示:PyPI 装出来的是 CPU 版 PyTorch,Nvidia 显卡用户想要 GPU 加速需要按 README 中文说明 另行安装 CUDA 版 torch,具体见后文常见问题。

命令行:一条 buzz add 直接出字幕

装好之后(PyPI 方式会自动带上 CLI),不打开界面也能干活:

buzz add -m whispercpp -s medium -l zh --srt meeting.mp3

这条命令的含义:用 Whisper.cpp 后端的 medium 模型,按中文转写meeting.mp3,结果输出为 SRT 文件。想同时要 VTT 就加--vtt,想只出纯文本就换成--txt。还支持一次传多个文件,或把整个目录打包处理:

buzz add --srt --output-directory ./subtitles recordings/*.mp4

完整参数(含 90 多种语言代码、初始提示词、单词级时间戳等)都在 CLI 参数文档 里。

完成信号:源文件同目录下多出了一个同名的 .srt 文件(输出目录默认为输入文件所在目录),用文本编辑器打开能看到带序号和时间轴的字幕条目。

实战场景:从视频字幕到会议实录

场景一:把视频音轨变成 SRT 字幕

目标:拿到一份能直接拖进剪辑软件的字幕文件。

  1. 在主窗口用工具栏的加号按钮导入视频文件,Buzz 会自动抽取音轨,你不需要自己转格式。
  2. 选中任务行,把任务设为 Transcribe,语言填中文,模型按机器性能选 small 或 medium,点运行。
  3. 转写完双击任务打开转录查看器,底部有播放条,点击某一行就能跳到对应时间点,边听边核对文字。
  4. 在顶部 Export 菜单导出 SRT 或 VTT。

产出:一个带精确时间戳的字幕文件。安静环境下 small 模型准确率就够用;环境嘈杂或语速快,升到 medium 再跑一遍更稳。

场景二:会议实时录音,边说边出字 🎙️

目标:开会时同步产出带时间戳的文字记录。

  1. 点工具栏的麦克风按钮,切到实时录音模式。
  2. 依次选择任务(Transcribe)、语言、模型和麦克风。这里建议用 Whisper.cpp 后端加 small 甚至 base 模型,因为默认 Whisper 后端对资源消耗很大,实时跑会拖慢队列。
  3. 点 Record 开始,下方面板随语音滚动出文字。
  4. 需要投屏时,点录音中出现的 Presentation window 选项,打开独立演示窗口把实时文字放大展示。
  5. 结束录音后保存,如果是多人发言,还可以对结果做说话人识别,把"谁说了什么"标注清楚。

产出:一份带时间戳的会议文字稿,可导出 TXT 或 SRT,之后还能翻译成其他语言归档(翻译功能需要配置一个支持 OpenAI API 的接口,见 翻译文档)。实时模式下"追加并纠正"模式可通过调整转录步长在延迟和负载之间取舍,详见 实时录音文档。

场景三:批量转录整个文件夹 📦

目标:几十个录音文件不点鼠标,自动处理完。

  1. 打开 Preferences 的 Folder Watch 选项卡,指定一个监视目录。
  2. 之后任何新的音频文件落进这个目录,Buzz 会自动建任务并开始转录。
  3. 如果你更喜欢脚本而不是守着 GUI,用前面提到的buzz add --srt --output-directory ./subtitles recordings/*.mp4一条命令处理整个目录,写进 shell 脚本或 CI 任务里即可。

产出:输出目录里与源文件一一对应的字幕或文本文件。注意批量任务按顺序排队执行,机器性能有限时把模型调小,整批跑完的时间会明显缩短。

常见问题

转录速度太慢,卡在哪了?

原因通常是模型对当前机器偏大,或者后端没吃到 GPU。⚡ 先降模型档位:tiny 或 base 比 large 快一个量级,精度损失在多数场景可接受。再换后端:Whisper.cpp 支持 CUDA 和 Vulkan 加速,Nvidia 显卡、其他品牌显卡、甚至只有核显的机器都能利用上。Windows 官方安装包自带 CUDA 12 运行时,Nvidia 显卡开箱即用。

Windows 安装时弹出安全警告,要紧吗?

不要紧。原因是安装包没有做代码签名,Windows 对未签名程序一律先警告。点"更多信息"再选"仍要运行"即可,这是预期行为,和中毒无关。

专有名词和术语老是认错?

原因是模型缺少领域上下文,或者语言自动检测判错了。两个办法配合使用:一是在高级设置里填初始提示词(CLI 对应-p参数),把常出现的术语、人名写进去,模型会优先按这些词来听;二是语言已知的情况下手动指定,别用自动检测,检测本身有概率出错。

PyPI 装的版本 GPU 不生效?

原因是 pip 默认装的是 CPU 版 torch。Windows 上按 README 说明改装 CUDA 版 torch 和对应 cu12 运行库(README 里给了现成的安装命令);Linux 上 Nvidia 显卡开箱即用,如果仍有问题检查 CUDA、cuBLAS、cuDNN 是否装齐。

完全断网的电脑也能转录吗?

能。前提是在有网的机器上先把模型下载好,然后整份拷贝到离线机器的同一位置:Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。在"帮助 → 偏好设置 → 模型"里下载过一个模型后点 Show file location 就能找到这个目录,仓库里也有 scripts/download-models.py 脚本帮你提前备好离线模型缓存。

二次开发:从这两个目录入手

想接新后端,看 buzz/transcriber/,Whisper、Whisper.cpp、Faster Whisper 各占一个文件,抽象层很薄;想加插件,看 buzz/plugins/,AI 摘要、DOCX 导出、字幕时长自动调整等内置插件都长在那里,照着 base.py 的接口写即可。

继续往下走

更完整的操作细节在 官方文档 里,按场景分篇写得比较细,遇到具体功能可以先去那边翻。发现 bug 或有改进想法,直接到项目 Issues 页面提交,维护者的响应频率很高。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 20:06:42

Simulink AD/DA转换器仿真:采样量化与串并转换链路实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/20 20:03:11

Lucky 部署与功能实操指南:端口转发、DDNS 与反向代理配置

Lucky 部署与功能实操指南:端口转发、DDNS 与反向代理配置 【免费下载链接】lucky 软硬路由公网神器,ipv6/ipv4 端口转发,反向代理,DDNS,WOL,ipv4 stun内网穿透,cron,acme,rclone,ftp,webdav,filebrowser 项目地址: https://gitcode.com/GitHub_Trending/luc/luck…

作者头像 李华
网站建设 2026/9/20 19:56:55

嵌入式AI与TinyML:MCU上的传感器本地推理实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华