Buzz 离线转录:把音频变成文字的免费本地工具完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费、离线、在你自己电脑上跑的音频转录工具,底层是 OpenAI 的 Whisper 语音识别模型,转写历史存在本地 SQLite 数据库里。不上传音频、不依赖云端,音频转文字全程本地完成,敏感会议录音、内部培训视频这些不方便过云的内容尤其合适。
打开主窗口,先看懂这张任务列表
主界面就一个任务表格,每行一个文件,列出后端、任务类型、状态和耗时。顶栏的麦克风图标切到实时录音模式,加号导入本地文件,箭头图标导入 URL。所有转写都进队列排队执行,一次丢十个文件进去就行,跑完点某一行打开转录查看器。
后端有四个:Whisper(transformers 原版,支持 GPU)、Whisper.cpp(把 Whisper 编译成 C++ 跑的加速版,吃 Vulkan/CUDA)、Faster Whisper、Hugging Face。同一个文件用不同后端结果略有差异,日常用哪个都行,速度敏感的场景更建议 Whisper.cpp。
三步跑通第一条转写
文件菜单 → 导入音频(或 Ctrl/Cmd+O),Buzz 自动抽取视频音轨,不用自己先转 mp3。然后在表格里给这个任务选语言和模型——语言已知就手动指定,比自动检测更准。点运行。
模型怎么选:如果机器配置一般,就选 small,速度和质量都够用;如果追求准确率且 GPU 带得动,更建议 medium 或 large-v3。模型在 设置 → 模型 页管理,下载/可下载列表都在这,Whisper.cpp 还支持填 URL 下自定义 ggml 模型。
转录查看器:按时间戳核稿、导出 SRT
转写结果是一行行的时间戳 + 文本,每段都有 Start/End 列,点任意一行播放条就跳到对应位置,音频对不上字一眼就能看出来。顶部四个按钮就是后期全流程:Export 选 TXT、SRT、VTT 直接进剪辑软件;Translate 把全文译成目标语言;Resize 是段落调整工具,拖动每个片段的起止边界做字幕校对。
实时录音与说话人识别
顶栏点麦克风开始边录边转,底部面板实时出字,默认留了缓冲延迟保证文字跟得上语音。开着活动或访谈时可以把转录窗口投到副屏或演示窗口给现场的人看。多人对话结束后,在查看器里跑一次说话人识别,Buzz 会区分同一录音里不同发言人,给每段标上归属,会议纪要整理就省了最烦的"谁说的"环节。
进阶:CLI 一条命令、文件夹监视与插件
buzz -m whispercpp -s medium -l zh --srt --hide-gui meeting.mp3这条命令指定 Whisper.cpp 后端、medium 模型、中文转写、输出 SRT 并隐藏界面,丢进脚本或 CI 里批量跑没问题,参数全貌在 docs/docs/cli.md。不想盯界面的还有文件夹监视:设置 → Folder Watch 里指定一个目录,新音频扔进去就自动建任务转写,配合同目录的 transcription_task_folder_watcher.py 可以看它怎么实现的。插件机制内置了 AI 摘要、DOCX 导出、字幕时长自动调整、跳过已转录片段几个,buzz/plugins/ 下有完整的插件说明,想加自己的后处理逻辑照着写就行。
| 后端 | 特点 | 适用场景 |
|---|---|---|
| Whisper.cpp | 纯 C++ 加速,Vulkan/CUDA 可选 | 批量、求速度 |
| Whisper (transformers) | 生态全,GPU 支持成熟 | 求稳 |
| Faster Whisper | CTranslate2 实现,内存效率高 | 老机器跑大模型 |
| Hugging Face | 可指定任意 HF 模型 ID | 试验社区微调模型 |
高频坑:现象 → 原因 → 解法
- 转写慢 → 模型对机器太大或后端没吃到 GPU → 换 tiny/base,或改用 Whisper.cpp 并启用 GPU(Nvidia 走 CUDA,通用显卡走 Vulkan)
- 专有名词、术语识别错 → 模型缺领域上下文 → 高级设置里填初始提示(initial prompt)垫几段背景文字,语言已知就手动指定
- Windows 安装报安全警告 → 安装包未做代码签名,属正常现象 → 选"更多信息"→"仍要运行"
- PyPI 版 GPU 不生效 → pip 默认装的是 CPU 版 torch → Windows 上按 README.md 说明改装 CUDA 版 torch 及对应运行库
技术底座
Python 3.12 + PyQt6 的桌面应用,转录历史和设置存本地 SQLite。多后端抽象集中在 buzz/transcriber/,每个后端一个文件,想接新后端从这入手最清晰;插件机制在 buzz/plugins/,内置 AI 摘要、DOCX 导出、字幕时长调整等插件,docs/docs/ 里的使用文档和 CLI 说明可以当手册查。
遇到问题或想改进,直接去项目 Issues 提就行,维护者响应很快。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考