Buzz 本地 Whisper 离线语音转文字完整教程:十分钟跑通首次转录,一路到导出字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
一段 40 分钟的采访录音躺在硬盘里,不想传到任何云端,又希望马上出文字——这就是 Buzz 的离线语音转文字要解决的场景。Buzz 是开源工具,底层是 OpenAI 的 Whisper 模型,整个转录过程都跑在你自己的电脑上,断网也能用。这篇教程带你从装好到导出字幕,走完一遍完整流程,并把调参、快捷键的常用项整理成速查表。
十分钟跑通第一次转录
第一次用不用研究任何设置,按平台走最短路径装好,然后"导入 → 转录 → 导出"走一遍就行。
按平台安装
- Windows:下载官方安装包双击安装。安装包未做签名,Windows 会弹警告,选"仍要运行"即可。
- macOS:
brew install --cask buzz一条命令装好,也可以下载.dmg直装;Apple 芯片用户还能从官方渠道拿到针对 M 系列芯片优化的版本。 - Linux:
flatpak install flathub io.github.chidiwilliams.Buzz,或者用 snap:
sudo snap install buzz sudo snap connect buzz:password-manager-service第二条命令把 Buzz 接到系统密码管理器上,snap 方式下别忘了。更多系统依赖和 pip 安装方式见 安装文档。
走一遍最短路径
首次使用会自动下载基础模型,预留约 1GB 磁盘空间,不用手动找文件。装好打开后:
- 点工具栏"导入文件"(
Ctrl+O),选一个 mp3 或 wav; - 左侧任务列表里这个音频会进入等待、转录中的状态变化;
- 转完右侧出现逐句文字和时间戳,点结果区右上角的导出按钮,选 TXT、SRT 或 VTT 存盘。
到这里整条链路已经通了,剩下的只是把模型和选项调对。
主界面就三大块,后面所有操作都在这三块里:
- 上方工具栏:录音、导入文件、导入 URL、清空历史这些核心按钮都在这一排;
- 左侧任务列表:每个导入的音频对应一个任务,实时显示等待、转录中、完成等状态;
- 右侧转录结果区:逐句显示文字和时间戳,可以直接点选、编辑,也可以跟着音频播放校对。
模型怎么选:五档对号入座
Whisper 模型只分五档,区别就是"快但糙"到"慢但准"。按需求对号入座即可,不用纠结参数:
| 档位 | 设备要求 | 速度 | 准确率 | 适合什么 |
|---|---|---|---|---|
| Tiny | 低配置电脑 | 极快 | 够用 | 实时转录、草稿 |
| Base | 普通电脑 | 快 | 良好 | 日常使用、首次跑通 |
| Small | 主流配置 | 中等 | 高 | 会议记录 |
| Medium | 高性能电脑 | 较慢 | 很高 | 正式文稿 |
| Large | 高性能显卡 | 慢 | 最高 | 高精度需求 |
三个实用细节:
- 偏好窗口(菜单打开,或按
Ctrl+,)里可以直接下载、删除模型,不用去网页上手动找文件; - 选 Whisper.cpp 引擎时,模型下拉里有Custom选项:填入模型
.bin文件的下载链接,就能用任意量化模型; - 显存不够,就在偏好里打开Reduce GPU RAM开关,模型会按 8bit 量化加载,等价于设环境变量
BUZZ_REDUCE_GPU_MEMORY=true。
按场景进阶:实时、精校、出字幕
三种常见诉求对应三条路线:要快不要准,用实时录音;要准不要快,转完逐句精校;要出字幕,转完重排再导出。
要快不要准:实时录音转写
开会、听讲座不想回头整理录音,就让它边录边出字:
- 按
Ctrl+R打开录音窗口,选输入设备(麦克风); - 选语言,模型挑响应快的 Base 或 Small——实时场景速度比准确率更要紧;
- 选转录模式,共三档:追加在下方(新句子排在末尾)、追加在上方(新句子排最前,直播字幕常用)、追加并修正(会回头纠正上一句的错字,比较吃算力);
- 点录制,文字就实时刷出来了。
录音转写还支持把实时文字同步导出成文本文件,方便投屏或接入其他工具,偏好里 "Live transcript exports" 一节有说明。官方对录音模式的说明在 实时录音文档。
要准不要快:正式文稿逐句精校
正式文稿靠的不是重跑,而是转完之后一句句校:
- 播放校对:
Ctrl+P播放或暂停音频,Ctrl+G跳到当前播放位置,边听边改; - 改错字:点任意一句直接改文本,识别错了不用重新转录;
- 时间轴微调:选中句子后,
Ctrl+←/Ctrl+→调起始时间,Ctrl+Shift+←/Ctrl+Shift+→调结束时间; - 视图切换:
Ctrl+E纯文本、Ctrl+T带时间戳、Ctrl+L译文,Ctrl+F在转录文本里搜索。
校对完导出时支持 TXT、SRT、VTT;纯文本导出按静音切段,默认 2000 毫秒,用BUZZ_PARAGRAPH_SPLIT_TIME可调。逐句编辑的完整操作参考 转录查看器文档。
要出字幕:重排长度再导出
转出来的句子有时太碎、有时太长,直接导出的字幕没法用。结果区打开"调整"面板,设定每行目标长度,Buzz 按时间间隔规则把短句合并、长句拆开,之后直接导出 SRT/VTT 就是能投出去的字幕文件。
想自定义合并规则,设环境变量BUZZ_MERGE_REGROUP_RULE指定 regroup 规则即可。
另外,项目自带一批插件(源码在 buzz/plugins/):AI 摘要、增强语言检测、导出 Word、跳过已转录片段、转录重排等,在偏好窗口的插件页面可以单独启用和配置,插件系统说明见 插件文档。
参数速查表:环境变量 + 快捷键
不放进偏好界面的高级选项都靠环境变量控制,写个启动脚本改几行就行(Linux/macOS 示例):
export BUZZ_WHISPERCPP_N_THREADS=8 export BUZZ_FAVORITE_LANGUAGES=zh,en,ja buzz性能相关
| 变量 | 作用 |
|---|---|
BUZZ_WHISPERCPP_N_THREADS | Whisper.cpp 线程数,默认是 CPU 核心数的一半。官方测试:16 线程笔记本设成 8 可提速约 15%,再往上反而变慢 |
BUZZ_REDUCE_GPU_MEMORY | 设为true,用 8bit 量化压缩模型,省显存 |
BUZZ_FORCE_CPU | 设为true强制走 CPU 模式 |
BUZZ_MODEL_ROOT | 指定模型存放目录,换盘放模型时设它 |
显示与操作相关
| 变量 | 作用 |
|---|---|
BUZZ_FAVORITE_LANGUAGES | 逗号分隔的语言代码,置顶显示,如zh,en,ja |
BUZZ_MERGE_REGROUP_RULE | 字幕重排(transcript resizer)的合并规则 |
BUZZ_PARAGRAPH_SPLIT_TIME | 导出纯文本时按多长的静音切段,单位毫秒,默认 2000 |
常用快捷键(完整定义见 buzz/settings/shortcut.py):
| 快捷键 | 操作 |
|---|---|
Ctrl+O | 导入音频文件 |
Ctrl+U | 导入视频网址,Buzz 会先下载音视频再转 |
Ctrl+R | 打开录音窗口 |
Ctrl+, | 打开偏好窗口 |
Ctrl+P | 播放 / 暂停音频 |
Ctrl+G | 跳到当前播放位置 |
Ctrl+F | 在转录文本中搜索 |
Ctrl+E/Ctrl+T/Ctrl+L | 切纯文本 / 时间戳 / 译文视图 |
Ctrl+←/Ctrl+→ | 微调选中句子的起始时间 |
Ctrl+Shift+←/Ctrl+Shift+→ | 微调选中句子的结束时间 |
Ctrl+X | 取消当前转录 |
Ctrl+S | 清空任务历史 |
所有快捷键都能在偏好窗口的快捷键编辑页里改成自己顺手的组合。完整变量清单见 偏好设置文档。
常见问题:先定位,再处理
转录太慢,怎么办?
换小一号的模型(Small→Base);把BUZZ_WHISPERCPP_N_THREADS调到 CPU 核心数一半左右,官方测试 16 线程笔记本设成 8 可提速约 15%;关掉吃 CPU 的其他程序;有独显的话确认引擎选了对应 GPU 支持的 Whisper 引擎。
模型下载中断了,怎么办?
到偏好窗口删掉这个模型重新下载;如果是磁盘满了导致失败,设BUZZ_MODEL_ROOT把模型目录换到有空间的盘上。
长音频显存爆了?
开 Reduce GPU RAM(或设BUZZ_REDUCE_GPU_MEMORY=true)让模型按 8bit 量化加载;实在不行,把长音频手动切段分别转录。
GPU 报错或驱动冲突?
设BUZZ_FORCE_CPU=true强制 CPU 模式,慢一点但稳,适合老显卡上 GPU 路径不稳定时。
语言列表太长,找不到常用的?
设BUZZ_FAVORITE_LANGUAGES=zh,en,ja(按自己常用改),这些语言会置顶显示。
实时转录跟不上说话速度?
实时场景别用 Medium/Large,换 Small 或 Base;"追加并修正"模式吃算力,跟不上时改回普通追加模式。
适合谁,怎么最快上手
- 适合:手里有不想上云的会议录音、采访素材、课程讲义,想在本机离线语音转文字、顺手导出字幕的人;
- 谨慎:纯实时场景别指望 Medium/Large 跟得上说话速度;Windows 首次安装要接受未签名安装包的警告,属正常现象;
- 最快上手:装好后先丢一段 1–2 分钟的短音频,用 Base 模型跑一遍"导入 → 转录 → 导出",确认流程通了,再上大模型处理正式素材。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考