news 2026/9/7 6:28:03

把声音变成可编辑文字:Buzz 离线语音转文字 15 分钟上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
把声音变成可编辑文字:Buzz 离线语音转文字 15 分钟上手指南

把声音变成可编辑文字:Buzz 离线语音转文字 15 分钟上手指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

把 MP3 拖进 Buzz 的导入窗口,选好 base 模型,点 Run,一两分钟后双击任务,逐句带时间戳的文字就躺在查看器里。Buzz(Buzz 离线语音转文字工具)解决的就是这件事:在你自己的电脑上完成本地 Whisper 转录,不上传、不限时长、断网也能转。

项目定位:Buzz 是什么

  • 技术底座:OpenAI 的 Whisper 模型(开源的多语言语音识别模型,一次覆盖 90 多种语言),另支持 Whisper.cpp、Faster Whisper、Hugging Face 等多家实现;
  • 部署形态:Windows / macOS / Linux 的图形界面安装包,外加一个 CLI(命令行)入口,处理全程在本机完成;
  • 适合谁:需要整理会议录音、课程音频、外语素材的普通用户;不适合追求云端并发、不想管理模型文件的团队。

安装与首次出稿

装好它:Buzz 安装步骤

系统方式一条命令
Windowswingetwinget install ChidiWilliams.Buzz
macOSHomebrewbrew install --cask buzz
LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz
任意系统PyPIpip install buzz-captions && python -m buzz

Windows 安装包未做代码签名,安装时弹出安全提示属正常现象,点"更多信息"→"仍要运行"即可继续。

跑出第一段文字:首次转录 5 步

  1. 点菜单"文件 → 导入媒体文件"(Ctrl+O),选中 MP3、WAV、MP4 等文件。
  2. 在导入表单里设置三个关键参数:Task选 Transcribe(同语言转录);Language手动选中文zh而不是自动检测——手动指定能明显提升准确率;Modelbase(快速预览)或small(更准,8GB 内存的笔记本上处理耗时约为音频时长的 2 倍,10 分钟的音频大约 20 分钟)。
  3. 点 Run,任务进入队列,主界面显示实时进度。
  4. 等状态变成 Completed,耗时、模型、任务类型都在任务列表里。
  5. 双击任务行,进入转录查看器,第一份文字稿就出来了。

从"能跑"到"好用":后期处理与导出

转录稿拿到手后,查看器里的三个动作决定它能不能直接用。

查看与校对

左上角按钮切换三种视图:时间戳表格、纯文本、翻译。表格里的文本单元格双击即可修改,改动自动保存。听音对稿离不开这几组快捷键:

  • Ctrl+P播放/暂停,Ctrl+Shift+P重播当前段;
  • Ctrl+G滚动到当前播放位置;
  • Ctrl+←/Ctrl+→微调当前段开始时间,Ctrl+Shift+←/Ctrl+Shift+→调结束时间;
  • Ctrl+T/Ctrl+E/Ctrl+L分别切到时间戳、纯文本、翻译视图。

重新断句

点工具栏的 Resize 打开字幕重组:按标点拆段、按最大长度(默认 42 字符)截断,把 Whisper 随意切分的长句整理成规整的字幕行。

重组依赖词级时间戳,转录前需要在高级设置里勾选 word-level timings,事后无法补。

导出

点"导出"按钮选择格式,转录文本和译文都能单独导出:

格式典型用途适用场景
TXT纯文本存档放进文档、喂给大模型
SRT视频字幕导入剪映、Premiere 等剪辑软件
VTTWeb 字幕网页播放器、B 站上传

更多细节可看 docs/ 目录下的使用说明。

场景化玩法:按任务挑场景

边开会边出稿:实时录音转录设置

会议进行中就要出稿?切到 Live Recording 标签页,选麦克风、语言、模型,点 Record,文字边说边出。

关键设置:实时转录必须用 Whisper.cpp 后端 +base或更小的模型,否则文字跟不上语速;长会议可开启"Append and correct"模式,让模型回头修正刚生成的句子,代价是更吃硬件。演示窗口(Presentation Window)能把实时字幕投到第二块屏,配合"实时转录导出到文本文件"还能把字幕流接进 OBS。

一个文件夹一次转完:CLI 批量

文件一多,逐个点 Run 就慢了,交给命令行:

buzz add --model-type whispercpp --model-size small --language zh \ --prompt "专有名词:张三、项目星云" --srt --vtt *.mp3

高频坑:--prompt里写上人名、产品名等专有名词,错字率会明显下降,这是最便宜的"自定义词典"。

外语素材直接出英文稿:离线翻译

手里只有外语音频、却想直接拿英文稿?两条路:

  • 任务类型选 Translate to English,这是 Whisper 自带的能力,全程离线;
  • 要任意目标语言(比如中译西),在偏好设置里填一个 OpenAI 兼容接口,指向本地 Ollama 或 LM Studio,再在查看器点 Translate,用一句指令限定"只翻译、不加注释"。

高频坑:Translate to English 只出英文;其他目标语言必须配置翻译接口,别指望离线凭空出现。

把电脑里的声音也转掉:系统音源捕获

要转的"麦克风"其实是屏幕里的声音(播客、在线课程)?用虚拟声卡把系统输出重定向给 Buzz:

  • Windows:VB-CABLE,系统输出设为 CABLE Input,Buzz 里选 CABLE Output;
  • macOS:BlackHole,在"音频 MIDI 设置"建多输出设备;
  • Linux:pavucontrol里把应用音频重定向到 Buzz。

高频坑:别忘了系统输出还得正常出声——多输出设备里要同时保留扬声器,否则会一边没声音一边转录。

模型与性能:先选对再谈快

模型大小决定速度、准确率和内存占用的平衡:

模型速度体感适用场景硬件要求
tiny / base分钟级出稿实时转录、快速预览纯 CPU 即可
small约为音频时长 2 倍日常转录的主力8GB 内存起步
medium / large小时级口音重、术语密集的专业录音建议 GPU
whisper.cpp 量化版接近实时纯 CPU 或老 GPU 机器任意

没有 NVIDIA 显卡就选 Whisper.cpp,它在 CPU 上也能实时转录;有显卡时,在偏好设置的模型选项里启用 CUDA(Linux 开箱即用,Windows 安装包内置 CUDA 12,旧版驱动会自动退回 CPU)。GPU 生效后的量级变化很直观:large 模型从小时级降到分钟级。

国内网络下载模型慢,启动前设置环境变量:HF_ENDPOINT=https://hf-mirror.com

排错速查

症状原因一句话解法
录音报错 PaErrorCode-9999系统拦截了麦克风权限到系统隐私设置里给 Buzz 放行
转录速度过慢模型太大换 base 或 Whisper.cpp 量化版
Resize 无法重组字幕没生成词级时间戳转录前勾选 word-level timings 重转
下载模型后卡死或闪退模型文件损坏在偏好设置 → Models 删除重下
离线机器用不了首次运行需下载模型在联网机器下载后,把模型缓存文件夹拷到同路径(Linux 为~/.cache/Buzz

今天就做一件事:导入一个文件,选 base、手动指定语言,点 Run,导出 SRT 看完整条流程。卡在哪一步,去项目仓库提 Issue,附上日志最快。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 6:27:47

GDevelop:用无代码和AI事件表,普通人也能做出可发布的2D游戏

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 6:27:22

AI漫剧量产全流程指南:从剧本到成片的工程化实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 6:25:32

AI Toolkit视频打标与LightX2V提示词重写:LoRA训练全流程实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 6:23:35

Python爬虫实战:B站高清视频下载与音画合并完整方案

简介:面向Python爬虫初学者的实战入门示例,演示如何批量下载哔哩哔哩小视频,并在控制台实时显示每个文件的下载进度。核心逻辑围绕分页请求展开:脚本循环遍历10页排行榜JSON数据,从中提取视频标题与直链地址&#xff0…

作者头像 李华