news 2026/9/6 16:19:12

Buzz 离线语音转文字完整指南:如何用 4 步跑出第一个转录结果

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字完整指南:如何用 4 步跑出第一个转录结果

Buzz 离线语音转文字完整指南:如何用 4 步跑出第一个转录结果

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的免费开源语音转文字工具,所有识别都在你自己的电脑上完成,音频不会离开本机,模型下载一次后即可完全离线工作。本文围绕会议纪要、视频字幕、批量转录三个高频场景,讲清完整的使用流程和调优要点。

首次转录最快上手步骤

  1. 安装。Windows / macOS 下载官方安装包运行即可(应用未签名,弹出警告时确认继续);Linux 一条命令搞定:
flatpak install flathub io.github.chidiwilliams.Buzz

也可以直接用 pip 安装,或git clone https://gitcode.com/GitHub_Trending/buz/buzz体验最新功能:

pip install buzz-captions python -m buzz

pip 方式需要先装好 ffmpeg 并使用 Python 3.12 环境。

  1. 导入音频。通过"文件"菜单或工具栏的"+"图标,选择要处理的音频或视频文件。
  2. 配置任务。任务选"转录",手动指定语言(自动检测只看开头几秒,手动指定明显更稳),选好模型后点击"运行"。
  3. 查看结果。状态变为"已完成"后双击该行打开查看器,边播放边核对文本,可导出 TXT、SRT、VTT 三种格式。

场景实操:三个高频用法卡片

🎙️ 会议实时纪要

适用场景:线下会议、访谈、讲座,需要边说边出文字。

关键 3 步:

  1. 主界面选"录音"任务,指定麦克风,点击"录音";
  2. 显示模式选"追加并校正",会持续修正上一句的识别错误,效果最接近人工记录;
  3. 在设置中开启录音转录导出,文字实时写入 TXT 文件,OBS 等直播软件可以直接读取。

产出结果:一份实时更新的文字流,还能打开演示窗口投到大屏上。多人对话可用"识别说话人"功能区分并标注不同发言人。

🎬 视频字幕制作

适用场景:给 MP4、MKV 视频挂字幕,或为剪辑软件准备字幕文件。

关键 3 步:

  1. 导入视频文件,Buzz 会自动提取音轨;
  2. 在高级设置里开启"词级时间戳",为每个词生成独立时间戳;
  3. 在查看器里点击"调整大小",按静音间隔和标点把词合并成标准字幕行。

产出结果:可直接挂载到播放器或剪辑软件的 SRT / VTT 字幕文件。

📦 批量自动转录

适用场景:固定目录持续归档录音,希望全程零操作。

关键 3 步:

  1. 在设置的"文件夹监视"选项卡中指定一个监视目录;
  2. 新放入的音频会自动创建转录任务,无需手动导入;
  3. 重复导入同一批文件时,用"跳过已转录"插件直接复用已有结果,不重跑模型。

批量操作也能一条命令行完成:

buzz add --task transcribe --model-size small --srt --vtt /path/to/audio.mp3

--srt--vtt决定导出字幕格式,--model-size指定模型大小;后面可以跟多个文件一次处理。

产出结果:自动转录 + 规范导出文件,配合脚本可以搭成完全无人值守的工作流。

进阶调优:模型、加速与防错

  • 模型大小:草稿用basesmall控制耗时;终稿校对用mediumlarge换准确率;实时录音建议小模型,保证跟得上语速。
  • GPU 加速:后端切到 Whisper.cpp,Nvidia 走 CUDA,AMD / Intel 走 Vulkan;显存不足选量化模型(如q_5),或在偏好设置中开启 8 位量化。
  • 手动指定语言:已知语种就别用自动检测,误识别会明显下降。
  • 初始提示:高级设置里填人名、产品名等易错词,纠正专有名词拼写。
  • 嘈杂录音:开启"语音提取",或用 DeepFilterNet 插件先降噪再转录。
  • 常见排错:速度太慢,换更小模型或用BUZZ_WHISPERCPP_N_THREADS调整线程数;模型下载慢,把HF_ENDPOINT指向镜像站;旧显卡越跑越慢,设BUZZ_FORCE_CPU=true强制走 CPU。
  • 纯离线部署:在有网电脑下载好模型,把模型缓存目录整体拷到离线机器即可,scripts/download-models.py可帮忙预取模型。

选型参考:Buzz 和同类方案怎么比

方案数据隐私联网要求费用实时录音易用性
Buzz全程本地处理下载模型一次后可完全离线免费开源支持图形界面 + 命令行,新手可直接上手
云端转录服务音频上传服务器必须联网按量收费支持网页 / API,需要配置密钥
纯命令行转录工具本地处理离线可用免费不支持仅 CLI,需要终端经验

资源收尾

  • 官方文档:docs/docs/
  • 转录核心模块:buzz/transcriber/
  • 插件系统源码:buzz/plugins/
  • CLI 用法:docs/docs/cli.md

✅ Buzz 的定位很清晰:一款免费的离线语音转文字工具,音频全程不出本机,图形界面和命令行两种方式都覆盖。对隐私敏感、又不想付转录费的音频工作,它可以在本地一次性解决。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 16:15:02

Workbench LS-DYNA显式动力学分析:从前处理到后处理实战解析

简介:《Workbench LS-DYNA技术培训》是一份面向结构仿真工程师的显式动力学分析培训资料,聚焦ANSYS Workbench LS-DYNA的前后处理、几何建模与求解设置。该PDF共1个文件,约3.74MB,内容从LS-DYNA程序在金属成型、冲击碰撞、爆炸及流…

作者头像 李华
网站建设 2026/9/6 16:14:55

基于8086的交通灯控制系统设计:从硬件架构到汇编实现详解

简介:这是一份基于8086微处理器的交通灯控制系统课程设计说明书,适合学习《微机原理与接口技术》、汇编语言及接口技术的本专科学生参考。文档围绕交通信号灯红、绿、黄定时切换与倒计时显示需求,给出从任务分析、总体方案设计、8255A与8253等…

作者头像 李华
网站建设 2026/9/6 16:13:35

磁力泵从零制作全流程:结构原理、装配调试与故障排查

简介:一项磁力泵制作方法的专利技术文档,面向流体机械、泵类设计及磁传动技术领域的工程技术人员,旨在解决传统单面磁力泵扭矩受限、轴承冷却与润滑条件不佳等痛点。文档围绕双面或多面磁偶合驱动创新,详细说明了主动器与被动器在…

作者头像 李华
网站建设 2026/9/6 16:10:17

双活数据中心原理图怎么画?从架构设计到评审要点全解析

简介:面向数据中心架构师、运维工程师及容灾方案规划人员,这份PPT以可修改原图形式,完整呈现双活数据中心的核心原理与拓扑设计,帮助读者快速理解两地三中心、主备故障域、仲裁节点等关键概念。资源为单个PPT文件,约3.…

作者头像 李华