Buzz:离线语音转录,音频不出本地,转录翻译一步完成
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的桌面端语音转录与翻译工具。如果你习惯把会议录音上传到云端再等待结果,这个过程是不是很烦。Buzz 是一款完全在本地运行的 Whisper 客户端,离线语音转录全程不需要联网。
📦 Buzz能做什么:离线语音转录功能速览
- 本地转录、翻译音频与视频文件
- 麦克风录音实时转录
- 文件夹监视自动转录新文件
- 结果导出为 TXT、SRT、VTT 等格式
🚀 3 分钟跑起来:安装与首次运行
安装
- Windows:下载安装包,按提示安装;出现安全提示时选择"更多信息",再点"仍要运行"。
- macOS:下载 .dmg 文件,把应用拖进"应用程序"文件夹,Apple Silicon 芯片原生支持。
- Linux:通过 Flatpak 安装,执行下面命令即可。
flatpak install flathub io.github.chidiwilliams.Buzz- Python 环境:需要 Python 3.12,并提前装好 ffmpeg。
pip install buzz-captions python -m buzz第一次使用
- 打开主界面,点左上角的"+"按钮导入一个音频或视频文件。
- 在任务列表里选择模型大小和音频语言。
- 点"运行",本地模型开始推理,完成后生成逐句转录。
- 双击任务行打开转录查看器,检查结果并导出。
主界面:任务导入、模型选择、进度展示在同一列表
⚙️ 核心功能详解
Buzz 是一款本地语音识别工具,下面 4 个功能覆盖了最常用的场景。
文件夹监视:把重复劳动交给程序
Buzz 可以监视一个指定目录,发现有新文件就自动开始转录。
- 在偏好设置里设置要监视的输入文件夹。
- 设置转录结果的保存路径。
- 把音频文件复制进文件夹,等待结果即可。
示例:下班前把 10 段采访录音丢进文件夹,第二天打开就是整理好的 TXT 文稿。
实时录音转录:边说边出文字
适合现场会议、访谈等正在发生的场景,发言的同时看到文字。
- 在偏好设置里选择录音模式:实时转录或追加校正。
- 设置转录延迟时间,保证结果完整。
- 点录音按钮开始,界面会随发言实时生成文字。
示例:一场 30 分钟的会议,结束后纪要的初稿已经成型,不用事后补录。
说话人识别:区分多人对话
Buzz 能标记转录稿中不同说话人的句子,并可试听确认。
- 双击任务打开转录查看器。
- 点"Identify speakers"按钮开始识别。
- 试听 10 秒音频样本,把标签改成说话人真实姓名。
- 保存后可把同一说话人的连续句子合并成一段。
示例:双人访谈转录后,文稿里"采访者"和"受访者"各归各位,导出即是对话稿。
多格式导出:按用途输出结果
转录完成后可导出多种格式,文件保存在输出目录里。
- 双击任务打开转录查看器。
- 选择导出格式:TXT、SRT 或 VTT。
- 设置导出文件命名模板,变量可替换为文件名等。
- 保存后在输出文件夹得到结果文件。
转录查看器:逐句编辑、调整时间戳、一键导出
🔄 一个完整工作流
以"给视频加字幕"为例,从原始文件到成片素材走一遍。
- 导入视频:点"+"选择 MP4 文件,Buzz 自动提取音轨。
- 设置参数:选 medium 模型和对应语言,点运行。
- 等待完成:生成带词级时间戳的转录稿。
- 调整字幕:启用 resize 插件,按间隙合并、按标点拆分片段。
- 预览检查:在查看器里核对每行字幕长度是否易读。
- 导出 SRT:拖进视频编辑软件,字幕直接生效。
Resize 插件:按间隙合并片段、按标点拆分
🔧 配置与调优
让它跑得更快
- 低配设备选 tiny 或 base 模型
- NVIDIA 显卡开启 CUDA 加速
- whisper.cpp 后端支持 Vulkan 加速
让它转得更准
- 重要内容用 large 模型
- 手动指定语言,别依赖自动检测
- 用初始提示词注明专有名词
自动化与批量处理
- 用 CLI 在脚本里批量转录
- 设置快捷键快速开始、停止录音
- "跳过已转录"插件避免重复计算
偏好设置:API 密钥、导出模板、录音模式配置
❓ 常见问题
Q: 转录速度太慢怎么办?A: 换成 tiny 或 base 这类小模型,推理时间会明显缩短。有 NVIDIA 显卡的话,开启 CUDA 加速效果最直接。
Q: 识别不准通常是哪些原因?A: 主要看模型大小和录音质量。手动指定语言、在初始提示词里写清楚专有名词,能改善很多误识别。
Q: 支持哪些文件格式?A: MP3、WAV、FLAC 等音频,MP4、MKV 等视频都可以导入,视频会自动提取音轨再转录。
Q: 不联网真的能用吗?A: 可以。作为本地语音识别工具,转录全程在你自己电脑上完成,音频文件不会离开本地。
Q: Mac 上说话人识别能用吗?A: Intel 芯片的 macOS 暂不支持该功能,Apple Silicon 的 Mac 不受影响。
📎 快速参考
| 导出格式 | 常见用途 |
|---|---|
| TXT | 纯文本,方便编辑整理 |
| SRT | 字幕,兼容多数视频编辑软件 |
| VTT | 在线网页视频字幕 |
| DOCX | Word 文档,由"Export to DOCX"插件导出 |
| 模型 | 适用场景 |
|---|---|
| tiny / base | 低配设备,快速预览 |
| small / medium | 日常使用,速度与准确率平衡 |
| large | 重要内容,准确率优先 |
- 官方文档:docs/docs/
- 插件系统源码:buzz/plugins/
Buzz 把转录流程完整搬回你自己的电脑,音频和结果都留在本地。装好后导入一个音频文件,就能体验离线语音转录。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考