news 2026/9/6 17:56:03

Buzz:免费离线语音转文字完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz:免费离线语音转文字完整指南

Buzz:免费离线语音转文字完整指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的离线语音转文字工具,由 OpenAI Whisper 驱动,全部转写在本地完成。音频文件永不离开设备,支持 99+ 种语言与多种规模的 Whisper 模型,适合会议纪要、采访字幕与讲座录音的批量处理。

解决什么问题

处理音频时,大多数人卡在三个地方:

  • 隐私:涉及商业机密的会议录音、医疗咨询对话不敢上传云端,而云端转录服务要求整段音频先过服务器。
  • 成本与网络:云服务按分钟计费,弱网环境不稳定,中小规模的录音需求还要排队等待。
  • 效率:人工整理采访、讲座的字幕极其耗时,一个视频常常要花掉整个下午。

Buzz 的思路是:在个人电脑上离线完成转录与翻译。下载合适的 Whisper 模型后,转写、翻译、字幕导出全部在本地闭环,音频不出设备。

Buzz 安装与首次转录

按平台选择一种安装方式,几分钟即可完成:

# macOS brew install --cask buzz # Linux flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz

Windows 直接运行安装包即可;应用未签名,提示拦截时点"更多信息"→"仍要运行"。开发者也可以用pip install buzz-captions后执行python -m buzz直接跑起来。

第一次转录的流程:

  1. 把音频或视频文件(MP3、WAV、M4A、OGG、MKV、MP4 等)拖入主界面。
  2. 选择模型——tiny 最快、large 最准,并手动指定语言避免误判。
  3. 点击运行,任务完成后双击该任务打开查看器:编辑文本、调整分段时长,再导出为 TXT、SRT 或 VTT。

核心能力拆解

转录引擎本地 transformers / whisper.cpp 后端与 OpenAI 兼容 API 后端并存,同一套任务可在纯离线与自建服务之间切换。支持 99+ 种语言,翻译任务可并行输出,tiny 到 large 的模型可任选,匹配不同硬件。

自动化文件夹监视功能会捕获指定目录的新文件并自动转录,适合固定落盘目录的录音笔。录音转写提供"向下追加""向上追加""追加并校正"三种模式,边播边记、事后统一修订都可以。说话人识别会按音色区分发言者并逐段打上标签。

性能NVIDIA GPU 可走 CUDA 加速,macOS 走 CoreML 路线,量化后的 whisper.cpp 模型进一步压低显存。模型越大精度越高也越慢,按硬件选档是提速的关键。

按角色看怎么用

记者 / 采访者用实时录音转写跟住访谈节奏,文字随发言滚动生成,结束后只需校对措辞。访谈场景选 medium 模型,速度和准确率的平衡最好,开始前手动设好语言。

视频创作者直接导入视频,Buzz 提取音频并生成带时间戳的字幕,导出 SRT 即可进剪辑软件。过长的字幕行可用 resizer 按屏宽拆分,避免遮挡画面。

研究者讲座录音成批处理:批量拖入文件,或让文件夹监视盯着存放目录,机器后台慢慢跑。非英语语料建议手动指定语言,比自动检测更稳。

企业用户把会议录音的落盘目录设为监视目录,散会后纪要草稿自动就位。再配合导出文件命名模板,交付物命名统一,方便归档和共享。

性能调优与常见坑

  • 转录太慢→ 换更小的模型、开启 GPU 加速、关闭占内存的后台程序。
  • 准确率偏低→ 手动指定语言,安静环境录制;专业术语写进"初始提示"引导模型。
  • 格式无法导入→ Buzz 支持 MP3、WAV、M4A、OGG、MKV 等常见音视频格式,冷门格式先转 MP3。
  • 长音频中途卡顿→ 检查磁盘与内存余量;大模型跑长音频建议用量化 whisper.cpp 路径。
  • Windows 安装被拦截→ 应用未签名属正常现象,点"更多信息"→"仍要运行"。

选型对比

与云端转录服务放在一起看:

维度Buzz云端转录服务
数据位置完全本地,音频不出设备必须上传服务器
网络离线可用依赖稳定网络
费用免费,仅一次性下载模型按分钟 / 字数计费
速度取决于本地硬件取决于服务器负载
自定义模型、导出模板、插件均可配置受限于固定 API

相对命令行形式的 whisper 开源工具,Buzz 的差异在于界面与流程:任务队列、可视化查看器、录音模式和插件体系让它对非程序员开箱即用;代价是常驻 GUI 的内存开销,服务端纯批量任务用 CLI 方案更轻。

技术架构速览

buzz/ ├── transcriber/ # 转录引擎 │ ├── file_transcriber.py │ ├── recording_transcriber.py │ └── whisper_cpp.py ├── widgets/ # 界面组件 │ ├── main_window.py │ └── transcription_viewer/ ├── db/ # entity / dao / service └── settings/ # 配置管理

三个核心入口:

  • 文件转录:buzz/transcriber/file_transcriber.py
  • 录音转录:buzz/transcriber/recording_transcriber.py
  • 主界面:buzz/widgets/main_window.py

Buzz 把语音转文字的全链路放在本地完成,从单场会议录音到批量归档都覆盖。

git clone https://gitcode.com/GitHub_Trending/buz/buzz

使用文档见:官方文档

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 17:51:53

数字频率计设计全流程:CPLD实现、时序控制与调试要点

简介:东华大学数字频率计课程设计报告,面向电子信息类学生与工程技术人员,完整呈现数字频率计从设计指标、系统方案到单元电路、调试测试的闭环流程。报告围绕四位有效数字、万分之一精度及100.0Hz~999.9kHz四档量程展开&#xff…

作者头像 李华
网站建设 2026/9/6 17:51:36

分布式系统教学设计:以图书商城案例贯穿核心概念

简介:一份面向计算机专业教师及学生的分布式系统概念教学案例设计与实践PDF文献,适用于课程设计、教学研讨及自学入门。文献针对分布式系统长期缺乏公认定义、学生难以把握其内涵的痛点,首先厘清分布性与协作性作为根本特征,同时辨…

作者头像 李华
网站建设 2026/9/6 17:47:32

开发中前端跟后端关于枚举类的使用

1.前端有些下拉框需要枚举类, 后端可以把所有枚举类统一集成一个枚举基类,用aop方式统一切入。弄一个controller统一返回给前端所有枚举类。2.后端统一存枚举实例名,可以定义一些字段(比如:lable,value&…

作者头像 李华
网站建设 2026/9/6 17:46:07

机械产品可靠性设计分析:从指标定义到加速寿命试验

简介:这份资源是一份源自北京航空航天大学工程系统工程系的机械产品可靠性设计分析PPT教学案例,聚焦某锁机构,适合机械/航天领域的可靠性工程师、高年级学生及从事装备研制的技术人员参考学习。资源共1个PPT演示文稿,大小约3.9MB&…

作者头像 李华
网站建设 2026/9/6 17:44:59

STC32G12K128计算e常数精确到小数点后9858位的汇编程序

STC32G12K128 单片机简介 STC32G12K128 是一款由宏晶科技 (STC) 生产的32位8051单片机,它的特点是: 32位 8051 架构,但速度比传统的8051约快 70倍。 1.9V 至 5V 工作电压,更适用于多种供电环境。 128K 字节 FLASH,用于存储用户代码。 4K字节内部 SRAM (edata),8K字节内部…

作者头像 李华