Buzz 本地转录:从音频文件到可导出字幕的 5 步流程
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的本地音频转录工具,在你自己的电脑上完成语音转文字和翻译,音频文件不需要上传到任何服务器。适合处理会议录音、采访素材这类不方便交给在线服务的内容。下面按你实际操作 Buzz 本地转录的顺序,走一遍从安装到导出字幕的完整路径。
装好 Buzz 并完成首次启动
本章解决"把工具跑起来"的问题。
- 选择一种安装方式:
- pip 安装(跨平台通用):先装好 ffmpeg 和 Python 3.12,然后执行:
pip install buzz-captions python -m buzz - macOS / Windows:从 SourceForge 的 buzz-captions 项目页下载 .dmg 或安装包。Windows 版未签名,安装时选"更多信息 → 仍要运行"即可。
- Linux:
flatpak install flathub io.github.chidiwilliams.Buzz,或sudo snap install buzz(详见 安装文档)。 - 从源码:
git clone https://gitcode.com/GitHub_Trending/buz/buzz后按仓库 pyproject.toml 的说明构建,适合需要最新功能的用户。
- pip 安装(跨平台通用):先装好 ffmpeg 和 Python 3.12,然后执行:
- 首次启动会提示下载 Whisper 模型,网络不佳时可稍后在偏好设置里补下。
- 确认主界面出现空的任务列表、工具栏的"+"按钮和左侧的转录设置面板,即代表环境就绪。
⚠️ GPU 用户注意:pip 安装的版本如需 Nvidia CUDA 加速,需额外安装对应版本的 torch,参考 README 的 GPU 说明;Mac 的 Apple Silicon 和多数 GPU 的 Vulkan 加速由 Whisper.cpp 后端原生支持。
第一次转录:导入文件并跑完一个任务
本章解决"拿到第一个转录结果"的问题,这是最小可用流程。
- 点击工具栏的"+"按钮(或按
Ctrl+O)→ 选择一个音频或视频文件,也支持直接粘贴 URL 导入网络视频。 - 在左侧设置区做三个选择:
- Task:
Transcribe(转成原语言文本)或Translate to English(直接翻译成英文); - Language:建议手动指定语言,自动检测在方言或混合语境下容易跑偏;
- Model:先用默认即可,模型取舍下一节再讲。
- Task:
- 点击Run。任务进入队列,状态变为
Completed即结束。 - 双击该任务行(或选中后点"⤢"图标)打开转录查看器,左侧播放音频、右侧逐段对照文本,确认结果。
两个省时间的选项藏在任务行的Advanced...按钮里:
- Initial prompt:把容易听错的专有名词(人名、产品名)写进去,能显著减少同音误写;
- Word-Level Timings:生成单词级时间戳,为后面按标点重切字幕做准备。
批量转录与命令行自动化
文件多起来之后,逐个点"Run"不现实。这一章给出三种批处理方式,由轻到重。
- GUI 多选:在文件选择对话框里按住
Ctrl选多个文件,一次性加入队列,每个任务可以独立设置模型和语言。 - Folder Watch 自动转录:打开偏好设置(
Ctrl+,)→ Folder Watch 选项卡,指定一个目录,之后新放进该目录的音频会自动开始转录。适合"录完往文件夹一扔就走"的工作流,配置细节见 偏好设置文档。 - CLI 无界面模式:Buzz 自带命令行入口
buzz add,关键参数(完整列表见 CLI 文档):buzz add -m whispercpp -s small -l zh \ --srt --txt --hide-gui \ ~/recordings/meeting.mp3-m选后端(whisper / whispercpp / fasterwhisper 等),-s选模型大小,-l指定语言,--srt --txt指定导出格式,--hide-gui让任务后台跑完自动退出。把这条命令写进 shell 循环或 cron,就是一个定时批处理管道。
提示:CLI 里不指定-l时默认自动检测语言;--word-timestamps可在命令行直接开启单词级时间戳。
选模型:在速度与准确率之间取舍
转录质量最终由模型决定。这一章解决"该装哪个模型、参数怎么配"的问题。
- 打开偏好设置(
Ctrl+,)→Models选项卡,这里统一管理所有模型的下载和删除。 - 按这个思路选:
- tiny / base:速度快、内存占用低,实时录音、嘈杂初筛、长音频快速出草稿;
- small / medium:准确率明显提升,是多数场景的平衡点;
- large:最准但最慢,留给需要交付级的内容。
- 想要更快,换后端:Whisper.cpp支持 CPU、Nvidia CUDA 和 Vulkan(含核显),实时录音场景官方文档也建议用它;Faster Whisper和Hugging Face系模型走 GPU 路线;OpenAI API后端则适合不想吃本地算力的场景。
- 显存紧张时,在模型大小里选量化版本(如
q5之类),或用 Custom 选项粘贴社区模型的 .bin 下载地址;偏好设置里还有"Reduce GPU RAM"开关进一步压缩显存占用。
经验值:日常保留 tiny + medium 两个模型足够覆盖"快速草稿"和"认真转录"两种需求;长音频先用小模型出全稿,再只把关键段落换大模型重跑,比整体上大模型省时间得多。
转录精修与字幕导出
转录结果很少能直接交付,这一章把结果变成可用的文本或字幕文件。
- 双击任务行打开转录查看器,直接点击文本单元格即可修改文字;
- 用
Ctrl+←/→按 0.5 秒步进调整片段起止时间,Ctrl+Shift+←/→调整结束时间,配合Ctrl+F搜索定位问题段落; - 点击工具栏Resize重排字幕:设置单条字幕最大长度、是否按标点断句,开启 Word-Level Timings 的转录还能分析音频静音点来对齐切分位置,另可给每条字幕加延长显示时间;
- 导出:工具栏Export菜单支持 SRT、VTT、TXT、JSON 等格式,文件名可用偏好设置里的模板(含日期、任务名等变量)统一命名;
- 锦上添花的插件:AI Summary 生成会议摘要、Speaker Identification 区分说话人、Transcript Resizer 自动重排字幕,都在Plugins菜单里启用,见 插件说明。
字幕排版上有个通用底线:单行不超过 40 个字符、每条字幕至少留 0.5 秒显示余量,导出前用 Resize 过一遍再交付。
到这里,Buzz 本地转录的完整链路就闭环了:装好应用 → 导入文件出结果 → 用 CLI 或 Folder Watch 上量 → 用模型参数调质量 → 用查看器和 Resize 精修导出。下一步建议:拿一段真实会议录音完整走一遍第二、五章的流程,重点试一次"word-level timings + Resize"的组合,这是产出可用字幕最顺的路径。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考