news 2026/10/7 2:27:26

Buzz 本地 Whisper 离线语音转文字完整教程:十分钟跑通首次转录,一路到导出字幕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 本地 Whisper 离线语音转文字完整教程:十分钟跑通首次转录,一路到导出字幕

Buzz 本地 Whisper 离线语音转文字完整教程:十分钟跑通首次转录,一路到导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

一段 40 分钟的采访录音躺在硬盘里,不想传到任何云端,又希望马上出文字——这就是 Buzz 的离线语音转文字要解决的场景。Buzz 是开源工具,底层是 OpenAI 的 Whisper 模型,整个转录过程都跑在你自己的电脑上,断网也能用。这篇教程带你从装好到导出字幕,走完一遍完整流程,并把调参、快捷键的常用项整理成速查表。

十分钟跑通第一次转录

第一次用不用研究任何设置,按平台走最短路径装好,然后"导入 → 转录 → 导出"走一遍就行。

按平台安装

  • Windows:下载官方安装包双击安装。安装包未做签名,Windows 会弹警告,选"仍要运行"即可。
  • macOS:brew install --cask buzz一条命令装好,也可以下载.dmg直装;Apple 芯片用户还能从官方渠道拿到针对 M 系列芯片优化的版本。
  • Linux:flatpak install flathub io.github.chidiwilliams.Buzz,或者用 snap:
sudo snap install buzz sudo snap connect buzz:password-manager-service

第二条命令把 Buzz 接到系统密码管理器上,snap 方式下别忘了。更多系统依赖和 pip 安装方式见 安装文档。

走一遍最短路径

首次使用会自动下载基础模型,预留约 1GB 磁盘空间,不用手动找文件。装好打开后:

  1. 点工具栏"导入文件"(Ctrl+O),选一个 mp3 或 wav;
  2. 左侧任务列表里这个音频会进入等待、转录中的状态变化;
  3. 转完右侧出现逐句文字和时间戳,点结果区右上角的导出按钮,选 TXT、SRT 或 VTT 存盘。

到这里整条链路已经通了,剩下的只是把模型和选项调对。

主界面就三大块,后面所有操作都在这三块里:

  • 上方工具栏:录音、导入文件、导入 URL、清空历史这些核心按钮都在这一排;
  • 左侧任务列表:每个导入的音频对应一个任务,实时显示等待、转录中、完成等状态;
  • 右侧转录结果区:逐句显示文字和时间戳,可以直接点选、编辑,也可以跟着音频播放校对。

模型怎么选:五档对号入座

Whisper 模型只分五档,区别就是"快但糙"到"慢但准"。按需求对号入座即可,不用纠结参数:

档位设备要求速度准确率适合什么
Tiny低配置电脑极快够用实时转录、草稿
Base普通电脑快良好日常使用、首次跑通
Small主流配置中等高会议记录
Medium高性能电脑较慢很高正式文稿
Large高性能显卡慢最高高精度需求

三个实用细节:

  • 偏好窗口(菜单打开,或按Ctrl+,)里可以直接下载、删除模型,不用去网页上手动找文件;
  • 选 Whisper.cpp 引擎时,模型下拉里有Custom选项:填入模型.bin文件的下载链接,就能用任意量化模型;
  • 显存不够,就在偏好里打开Reduce GPU RAM开关,模型会按 8bit 量化加载,等价于设环境变量BUZZ_REDUCE_GPU_MEMORY=true。

按场景进阶:实时、精校、出字幕

三种常见诉求对应三条路线:要快不要准,用实时录音;要准不要快,转完逐句精校;要出字幕,转完重排再导出。

要快不要准:实时录音转写

开会、听讲座不想回头整理录音,就让它边录边出字:

  1. 按Ctrl+R打开录音窗口,选输入设备(麦克风);
  2. 选语言,模型挑响应快的 Base 或 Small——实时场景速度比准确率更要紧;
  3. 选转录模式,共三档:追加在下方(新句子排在末尾)、追加在上方(新句子排最前,直播字幕常用)、追加并修正(会回头纠正上一句的错字,比较吃算力);
  4. 点录制,文字就实时刷出来了。

录音转写还支持把实时文字同步导出成文本文件,方便投屏或接入其他工具,偏好里 "Live transcript exports" 一节有说明。官方对录音模式的说明在 实时录音文档。

要准不要快:正式文稿逐句精校

正式文稿靠的不是重跑,而是转完之后一句句校:

  • 播放校对:Ctrl+P播放或暂停音频,Ctrl+G跳到当前播放位置,边听边改;
  • 改错字:点任意一句直接改文本,识别错了不用重新转录;
  • 时间轴微调:选中句子后,Ctrl+←/Ctrl+→调起始时间,Ctrl+Shift+←/Ctrl+Shift+→调结束时间;
  • 视图切换:Ctrl+E纯文本、Ctrl+T带时间戳、Ctrl+L译文,Ctrl+F在转录文本里搜索。

校对完导出时支持 TXT、SRT、VTT;纯文本导出按静音切段,默认 2000 毫秒,用BUZZ_PARAGRAPH_SPLIT_TIME可调。逐句编辑的完整操作参考 转录查看器文档。

要出字幕:重排长度再导出

转出来的句子有时太碎、有时太长,直接导出的字幕没法用。结果区打开"调整"面板,设定每行目标长度,Buzz 按时间间隔规则把短句合并、长句拆开,之后直接导出 SRT/VTT 就是能投出去的字幕文件。

想自定义合并规则,设环境变量BUZZ_MERGE_REGROUP_RULE指定 regroup 规则即可。

另外,项目自带一批插件(源码在 buzz/plugins/):AI 摘要、增强语言检测、导出 Word、跳过已转录片段、转录重排等,在偏好窗口的插件页面可以单独启用和配置,插件系统说明见 插件文档。

参数速查表:环境变量 + 快捷键

不放进偏好界面的高级选项都靠环境变量控制,写个启动脚本改几行就行(Linux/macOS 示例):

export BUZZ_WHISPERCPP_N_THREADS=8 export BUZZ_FAVORITE_LANGUAGES=zh,en,ja buzz

性能相关

变量作用
BUZZ_WHISPERCPP_N_THREADSWhisper.cpp 线程数,默认是 CPU 核心数的一半。官方测试:16 线程笔记本设成 8 可提速约 15%,再往上反而变慢
BUZZ_REDUCE_GPU_MEMORY设为true,用 8bit 量化压缩模型,省显存
BUZZ_FORCE_CPU设为true强制走 CPU 模式
BUZZ_MODEL_ROOT指定模型存放目录,换盘放模型时设它

显示与操作相关

变量作用
BUZZ_FAVORITE_LANGUAGES逗号分隔的语言代码,置顶显示,如zh,en,ja
BUZZ_MERGE_REGROUP_RULE字幕重排(transcript resizer)的合并规则
BUZZ_PARAGRAPH_SPLIT_TIME导出纯文本时按多长的静音切段,单位毫秒,默认 2000

常用快捷键(完整定义见 buzz/settings/shortcut.py):

快捷键操作
Ctrl+O导入音频文件
Ctrl+U导入视频网址,Buzz 会先下载音视频再转
Ctrl+R打开录音窗口
Ctrl+,打开偏好窗口
Ctrl+P播放 / 暂停音频
Ctrl+G跳到当前播放位置
Ctrl+F在转录文本中搜索
Ctrl+E/Ctrl+T/Ctrl+L切纯文本 / 时间戳 / 译文视图
Ctrl+←/Ctrl+→微调选中句子的起始时间
Ctrl+Shift+←/Ctrl+Shift+→微调选中句子的结束时间
Ctrl+X取消当前转录
Ctrl+S清空任务历史

所有快捷键都能在偏好窗口的快捷键编辑页里改成自己顺手的组合。完整变量清单见 偏好设置文档。

常见问题:先定位,再处理

转录太慢,怎么办?

换小一号的模型(Small→Base);把BUZZ_WHISPERCPP_N_THREADS调到 CPU 核心数一半左右,官方测试 16 线程笔记本设成 8 可提速约 15%;关掉吃 CPU 的其他程序;有独显的话确认引擎选了对应 GPU 支持的 Whisper 引擎。

模型下载中断了,怎么办?

到偏好窗口删掉这个模型重新下载;如果是磁盘满了导致失败,设BUZZ_MODEL_ROOT把模型目录换到有空间的盘上。

长音频显存爆了?

开 Reduce GPU RAM(或设BUZZ_REDUCE_GPU_MEMORY=true)让模型按 8bit 量化加载;实在不行,把长音频手动切段分别转录。

GPU 报错或驱动冲突?

设BUZZ_FORCE_CPU=true强制 CPU 模式,慢一点但稳,适合老显卡上 GPU 路径不稳定时。

语言列表太长,找不到常用的?

设BUZZ_FAVORITE_LANGUAGES=zh,en,ja(按自己常用改),这些语言会置顶显示。

实时转录跟不上说话速度?

实时场景别用 Medium/Large,换 Small 或 Base;"追加并修正"模式吃算力,跟不上时改回普通追加模式。

适合谁,怎么最快上手

  • 适合:手里有不想上云的会议录音、采访素材、课程讲义,想在本机离线语音转文字、顺手导出字幕的人;
  • 谨慎:纯实时场景别指望 Medium/Large 跟得上说话速度;Windows 首次安装要接受未签名安装包的警告,属正常现象;
  • 最快上手:装好后先丢一段 1–2 分钟的短音频,用 Base 模型跑一遍"导入 → 转录 → 导出",确认流程通了,再上大模型处理正式素材。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 2:25:35

公司不经营了放任不管会怎样?后果比你想的重

公司不经营了放任不管会怎样?后果比你想的重 一分钟看答案 公司不经营了,放任不管的代价不是"慢慢拖",而是逐级加重: 0-6 个月:看起来没事,实际年报、税务申报已经开始逾期;6-12 个月…

作者头像 李华
网站建设 2026/10/7 2:25:21

JavaScript 正则表达式锚点实战:为什么 `^$` 只匹配空字符串

文档/教程前端 【免费下载链接】en.javascript.info Modern JavaScript Tutorial 项目地址: https://gitcode.com/gh_mirrors/en/en.javascript.info 点击查看 免费下载 ^(脱字符)与 $(美元符)是 JavaScript 正则表达…

作者头像 李华