news 2026/9/7 2:33:37

Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字

Buzz 完整教程:如何在电脑上零基础搭好离线语音转文字工具,把音频转成文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款开源的离线语音转文字应用,它在你自己的电脑上调用 OpenAI 的 Whisper 模型(一个把语音转成文字的深度学习模型)完成音频转录和翻译,全程不需要把录音上传到任何服务器。它适合两类人:一是手里有大量会议、课程、采访录音,需要批量转成文字或字幕的人;二是处理内容敏感、绝不能联网上传的隐私场景。本教程从确认电脑能不能跑,到安装、第一次转录、调模型提速,再到排错,一条线讲完。

📋 先确认:Buzz 适不适合你的场景

选型前先看结论,避免装完才发现用不上:

你的情况结论说明
音频必须留在本机或内网✅ 正合适转录在本地完成,模型下载后即可离线工作
会议录音、课程、播客批量转文字✅ 正合适支持队列任务、文件夹监控自动转录
给视频做 SRT / VTT 字幕✅ 正合适转录结果可直接导出字幕格式,还能按词重新切分
想要"秒级"跟读式的实时转录⚠️ 有门槛实时录音比较吃资源,需要用 Whisper.cpp 后端加小模型,硬件弱会追不上
只有老旧笔记本(不支持 AVX2 指令集)❌ 跑不了Buzz 依赖 AVX2,太老的 CPU 直接排除
完全离线的内网机器⚠️ 可以但要准备模型文件要先在联网机器下载好,再拷贝过去(见离线准备脚本)

系统要求不苛刻:Windows 10+、macOS(Intel 与 Apple Silicon 均可)、主流 Linux 发行版;普通双核 CPU 能跑小模型,8GB 内存以上体验更稳。模型文件的位置是固定的,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache,macOS 在~/Library/Caches/Buzz,Linux 在~/.cache/Buzz,管理空间时心里有数。

🚀 装好并跑起来:三个平台各一条推荐路线

每个平台只走一条最省事的路,装完启动看到主界面就算成功。

Windows:从官方发布页下载.exe安装文件直接安装。应用没有做代码签名,安装时系统会弹安全警告,点"更多信息"再选"仍要运行"即可,这不是中病毒。安装包自带 CUDA 12 支持,N 卡用户无需额外配置。

macOS:下载.dmg后拖进"应用程序"文件夹,Apple Silicon 和 Intel 版都有。

Linux:一条 Flatpak 命令:

flatpak install flathub io.github.chidiwilliams.Buzz

备选路线(一行流):Linux 也可以sudo snap install buzz(需先装libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module三个依赖,并执行sudo snap connect buzz:password-manager-service);或者用 Python 3.12 环境执行pip install buzz-captions后运行python -m buzz(需自行装好 ffmpeg)。

验证是否装好:打开 Buzz 能看到任务列表界面,点工具栏的 "+" 图标能弹出文件选择框,录音按钮能点亮,就说明环境没问题。

🎧 第一次使用:把一个音频文件变成文字

目标只有一个:导入一个音频文件,拿到文字。

  1. 点菜单File → Import Media File(或工具栏 "+" 图标,快捷键 Ctrl/Cmd + O),选中你的音频或视频文件——注意 Buzz 也能直接粘贴视频链接导入,视频里的音轨同样可以转。
  2. 任务栏里选择Transcribe(转写);语言手动选一个,比自动检测稳得多,官方文档明确建议别依赖自动检测。
  3. 模型先用 Whisper.cpp 的 small 起步,够快也不至于错得离谱。
  4. Run,进度列会显示百分比,状态变成 Completed 即完成。
  5. 双击这一行,打开转录查看器,每段文字都带开始/结束时间戳,底部有播放器可以边听边改。
  6. 在查看器里改完错字,用 Export 菜单导出 TXT、SRT 或 VTT。

导入时点 "Advanced..." 还能看到几个实用开关:Word-Level Timings(按词生成时间戳,为之后切字幕做准备)、Extract speech(先把人声从背景音里抽出来再转,嘈杂音频可用)、以及Initial prompt(初始提示词,把容易拼错的专有名词、术语写进去,能显著减少错字)。

⚙️ 选模型与调速度:先定后端,再定档位

"转得太慢"和"错得太离谱"都出在模型选择上。Buzz 里其实有两层选择:先用哪个后端(怎么跑),再用哪个大小的模型(跑多大)。

后端怎么挑:

你的硬件后端选择理由
没有独显 / 集显Whisper.cpp基于 Vulkan 加速,任何显卡都能用,纯 CPU 也能跑;Mac 上它是最佳选择
N 卡,显存 ≥ 6GBFaster Whisper比原版 Whisper 快一个数量级,吃显存
内存充裕、追求原始精度Whisper(原版)准确但慢、吃内存
想用特定语言的定制模型HuggingFace支持 MMS(覆盖上千种语言)等第三方模型家族
本地硬件弱到转不动OpenAI API放到远端算,需配置 API Key,要联网

模型档位怎么挑:

档位参数量级定位
tiny / base约 39M / 74M实时录音、快速过一遍,错字多
small约 244M日常主力,速度和准确率的平衡点
medium约 769M长音频、要求高的内容
large-v3 / large-v3-turbo约 1.5B最准;v3 偶尔会"幻听"出没说的词,turbo 版主打速度精度平衡

官方 FAQ 的建议很实在:各档位之间没有标准答案,用你自己的语言各试一遍最靠谱。模型在Help → Preferences → Models页下载,下完还能点 "Show file location" 找到文件。Whisper.cpp 还支持量化版(如 q_5)和自定义模型 URL,省显存、可换多语言模型。

提速的关键调节项(多数在 Preferences 里,高级项通过环境变量设置):

  • BUZZ_WHISPERCPP_N_THREADS:Whisper.cpp 线程数,默认是 CPU 核心数的一半;16 线程的笔记本设成 8 反而快约 15%,设太高线程合并开销会拖慢速度。
  • BUZZ_FORCE_CPU=true:显卡驱动有坑时强制走 CPU。
  • BUZZ_REDUCE_GPU_MEMORY=true:用 8 位量化压缩模型,省显存。
  • BUZZ_MODEL_ROOT:把模型目录指到大磁盘上。
  • HF_ENDPOINT:模型下载慢时,设成https://hf-mirror.com换镜像加速。

PyPI 安装的用户要 GPU 加速需手动装 CUDA 版 PyTorch(两条核心命令):

pip3 install -U torch==2.8.0+cu129 torchaudio==2.8.0+cu129 --index-url https://download.pytorch.org/whl/cu129 pip3 install nvidia-cublas-cu12==12.9.1.4 nvidia-cuda-cupti-cu12==12.9.79 nvidia-cuda-runtime-cu12==12.9.79 --extra-index-url https://pypi.nvidia.com

Linux 的 N 卡开箱即用,Windows 安装包已内置。显卡太老反而拖慢速度时,用BUZZ_FORCE_CPU=true退回 CPU 通常更快。

🧰 进阶玩法:实时录音、翻译、批量与命令行

实时录音:点工具栏的麦克风图标,选好麦克风、任务、语言就开录。官方提醒:默认 Whisper 后端做实时转录很吃资源,建议切到 Whisper.cpp 并用小模型。录音开始后会出现Presentation window(演示窗口)选项,适合讲座、会议场景投屏展示实时字幕。要录电脑里播放的声音(而不是麦克风),需要配一个虚拟声卡,macOS 用 BlackHole、Windows 用 VB CABLE,把系统输出接到虚拟设备后,在 Buzz 里选它当麦克风即可。

翻译:分两种。Transcribe 之外的默认翻译任务走 Whisper 自带的"译成英语"能力,纯离线;译成英语以外的语言则需要 AI 翻译——在 Preferences 里填一个 OpenAI 兼容 API 的 Key 和地址(也支持 Ollama、LM Studio 这类本地部署),给 AI 一段明确的翻译指令即可。开启实时转录导出后,文字会边生成边写进 txt 文件(译文是.translated.txt),方便接 OBS 等工具。官方给的参考成本:约 1 美元可翻译 1 小时音频。

批量与自动:任务列表本身就是队列,导入一堆文件会依次排队转录。更省事的是Folder Watch(Preferences 里的选项卡):指定一个文件夹,新丢进去的音频自动进转录队列。

插件(1.4.5 起):Help → Plugins 里开关、拖拽排序、按 URL 添加社区插件。内置的几个很实用:AI Summary(调 API 生成摘要存进备注)、Export to DOCX(导出 Word)、Resize Transcript(自动把按词的转录合并成字幕段)、DeepFilterNet 降噪(转前先消噪)、Skip Already Transcribed(重导同一文件夹时跳过已转过的文件)。插件机制的源码在 buzz/plugins/,照着写自己的不难。

命令行:Buzz 自带 CLI,可写进脚本做自动化,完整参数见 docs/docs/cli.md。最高频的一条:

# 转录一个 MP3,同时导出 TXT 和 SRT buzz add -m whispercpp -s small -l zh --txt --srt input.mp3

-t translate可切换成翻译任务,--model-type还能选 fasterwhisper、huggingface、openaiapi 等后端。

🛠️ 排错:常见问题对照表

症状处理办法
转录太慢换更小模型或换 Whisper.cpp 后端;显存 ≥6GB 的 N 卡上改 Faster Whisper;有更强的机器就用更大的模型
启动崩溃多半是模型文件下载不完整——在 Preferences → Models 删掉重下;再不行看日志(Help → About Buzz → Show logs),并注意 CPU 是否支持 AVX2
录音报Unanticipated host error [PaErrorCode-9999]系统层面禁止了麦克风访问。Windows 到 设置 → 隐私 → 麦克风 里给应用开权限,并临时排查杀毒软件
内网无网机器怎么用在联网机器下载模型后,把模型文件夹整体拷到目标机的对应缓存目录(路径见前文),可配合 scripts/download-models.py 批量准备
实时字幕追不上语速换 tiny/base 模型 + Whisper.cpp,调大 Transcription step(实时录音高级设置里),牺牲一点延迟换负载
Flatpak 版不跟随深色主题安装gnome-themes-extra,把主题复制到~/.themes并给 Flatpak 开访问权限,详见 FAQ
字幕时间戳对不上、一段太长转录时勾 Word-Level Timings,完成后用 Resize 工具按静音间隔和标点重新合并

排完这些还解决不了的,去项目仓库提 issue,附上日志文件,维护者响应很快。

结语

Buzz 把"离线语音转文字"这件事拆得很直白:装好、选模型、丢文件,剩下的时间都花在改错字上。想参与项目本身,可以从 docs/ 文档、翻译 locale 语言包 或给 buzz/plugins/ 写一个插件开始。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 2:33:30

PLC抽水泵站控制方案:从继电器逻辑到恒压供水PID调节

简介:这是一份以抽水泵水位控制为场景的PLC控制系统课程设计参考文档,主要面向自动化、电气类专业的课程设计或毕业设计使用。内容从系统概述、方案论证到硬件与软件设计层层展开,既给出了传统继电器控制与PLC控制方案的对比,也明…

作者头像 李华
网站建设 2026/9/7 2:33:03

高管追问生成式AI能省多少,我算完成本模型,结论反直觉

高管追问生成式AI能省多少,我算完成本模型,结论反直觉 周三下午三点,我被叫进副总办公室。他直接把一页 AIGC 试点提案拍在桌上,甩过来一个问题:“你用生成式AI给客服系统写回复模板,如果全量上线,一个月能给公司省多少人力?” 我当时挺有信心地回了一句:“我晚上跑个模型,明…

作者头像 李华
网站建设 2026/9/7 2:32:23

本质非线性下的描述函数法:自振分析与工程验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 2:28:20

双引擎解耦架构如何实现工业设备5分钟接入?JVS实践解析

1. 项目概述:JVS双引擎解耦到底在解什么 工业设备接入这件事,真做过的朋友都懂。明明协议就那几类,Modbus、OPC UA、三菱PLC、西门子S7,翻来覆去就那些寄存器地址和字节序,但每次新接一台设备,还是得让开发…

作者头像 李华
网站建设 2026/9/7 2:26:57

专业教材编写必备:AI写教材,快速搭建框架并生成完整内容!

刚完成高校教材编写的初稿后,接下来的修改和优化过程简直让人头疼。要一遍又一遍地通读全文,找出逻辑上的漏洞和知识点的错误,光是这个环节就得花费不少时间。更麻烦的是,稍微调整一个章节的结构,后面的内容就会连带被…

作者头像 李华