news 2026/9/7 6:04:33

Buzz 离线语音转文字:Whisper 本地音频转录,4 步导出字幕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字:Whisper 本地音频转录,4 步导出字幕

Buzz 离线语音转文字:Whisper 本地音频转录,4 步导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议结束后,录音文件躺在硬盘里,你要的不是逐句听写,而是带时间戳的文字稿,最好能直接导出成 SRT 字幕。Buzz 是一款离线音频转录工具,基于 OpenAI Whisper,转写与翻译全部在本地电脑完成,音频不上传到任何服务器。它适合处理会议录音、给个人视频配字幕、转录外语播客的人,免费开源,无按量计费。

4 种方式安装 Buzz

  • Windows:从官方发布页下载安装程序。程序未签名,安装时若弹出安全警告,选择"更多信息"→"仍要运行"即可。

  • macOS:下载 .dmg 镜像安装,Apple Silicon 芯片可获得原生加速。

  • Linux:Flatpak 方式最省事:

    flatpak install flathub io.github.chidiwilliams.Buzz

    也可通过 Snap 安装:sudo snap install buzz

  • 从 PyPI 安装(适合开发者):先装好 ffmpeg 并准备 Python 3.12 环境,然后执行pip install buzz-captions,用python -m buzz启动。

首次使用:4 步完成一次离线转录

  1. 点击"导入媒体文件"(快捷键 Ctrl/Cmd+O),支持音频文件,也支持视频文件(自动提取音轨)。
  2. 为任务选择类型:转写或转写后翻译,再选择音频语言。语言可自动检测,手动指定通常更准。
  3. 在任务里选择模型大小,点"运行"开始处理。
  4. 完成后双击任务行,打开转录查看器核对文本与时间戳。

三条主要用法

批量转写已有录音。可以一次导入多个文件,每个文件生成独立任务并行排队;Buzz 还内置"监听文件夹"功能,把目录放进监听列表后,新放入的录音会自动开始转写,适合持续产出内容的场景。需要脚本化时可以改用命令行接口。

🎙️边说边转的实时录音。选择麦克风后点击录音按钮,Buzz 按固定延迟(默认 20 秒)滚动处理音频块,文字在界面中实时累积。演示或授课时可以切换到独立的演示窗口,把实时字幕投到大屏上。

转成文字后再翻译。任务类型选择"转写并翻译",Buzz 先转写出原文,再翻译为目标语言;查看器里可以在原文和译文之间切换对照,适合外语学习材料。若需要更高质量的翻译,还可以接入 OpenAI 兼容的 API 服务。

📦 导出结果与编辑时间码

转写完成后可以从菜单导出 TXT、SRT、VTT 三种格式。SRT 和 VTT 可直接导入视频剪辑软件或播放器作为字幕,TXT 适合做纪要底稿。

转录查看器承担校对工作:左侧文本列表按时间码组织,点击任意一条即可跳转到对应音频位置;播放控制条支持变速、循环播放片段。对不齐的地方可以直接修改某一段的开始/结束时间,也可以拆分或合并相邻片段。多人对话场景下可以开启说话人识别,为不同声音标注发言人。

⚙️ 影响质量与速度的 3 个设置

模型档位。Buzz 提供 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 四种后端,模型大小从 Tiny 到 Large 五档。Tiny/Base 速度快、占用小,适合批量处理;Medium/Large 准确率更高,但需要更大内存。有 NVIDIA 显卡可启用 CUDA 加速,Whisper.cpp 后端支持 Vulkan,集成显卡也能加速。

指定语言。知道音频语言时手动选择,可避免自动检测出错带来的识别偏差,Whisper 共支持 99 种语言。

初始提示。内容里出现大量专有名词、术语时,在高级设置中填一段包含这些词的初始提示,能明显降低错拼。环境侧同样重要:安静环境、离嘴近的麦克风、清晰的发音,对准确率的影响不亚于模型大小。

排障速查

  • 转写太慢:换 Tiny 或 Base 模型;NVIDIA 显卡确认 CUDA 已启用;或改用 Whisper.cpp 后端。
  • 准确率不够:换更大模型;手动指定语言;为术语添加初始提示;录音环境降噪。
  • 支持哪些格式:MP3、WAV、FLAC、OGG 等常见音频,以及 MP4、AVI、MKV 等视频(自动取音轨)。
  • 能否批量处理:可以。多文件同时导入、监听文件夹自动处理、命令行三种方式都支持。

技术背景与参与方式

Buzz 用 Python 和 PyQt6 编写,MIT 许可,代码按模块划分:buzz/transcriber/ 实现各后端的转写与录音逻辑,buzz/widgets/ 承载界面组件,buzz/db/ 管理转写历史的本地数据库。项目还有插件系统(AI 摘要、自动字幕切分等),想加新功能或修 bug,可以从 Issues 入手,按贡献指南提 PR。

收尾

Buzz 把"本地、免费、可离线"三件事同时做到:音频不出机器,模型随便切换,导出格式覆盖字幕工作流。如果你不想把录音交给云服务,从安装到第一条字幕,整个过程不超过十分钟。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 6:03:23

秋叶ComfyUI旗舰版:全中文AI绘画工具本地部署指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 6:03:08

ODAS开源嵌入式听觉系统:从原理到板级实作全攻略

简介:ODAS(开放分布式音频系统)是一套专为嵌入式设备设计的开源实时音频处理框架,面向机器人、无人机、自动驾驶及智能硬件开发者,解决资源受限环境下声源定位、音频跟踪、波束形成与声音分离等复杂听觉问题。随包共33…

作者头像 李华
网站建设 2026/9/7 5:57:50

用MATLAB实现火电厂热平衡计算:模型、迭代与工程实践

简介:面向火力发电厂热平衡计算场景,这套基于MATLAB的64位程序为电力工程师、热动专业学生提供了一套可运行的建模与分析工具,能将锅炉、汽轮机、回热系统等能量转换过程程序化,替代繁琐的手算与查表。资源共23个文件,…

作者头像 李华