news 2026/9/6 16:31:43

Buzz离线语音转录完全指南:从音频文件到可编辑字幕的5个步骤

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz离线语音转录完全指南:从音频文件到可编辑字幕的5个步骤

Buzz离线语音转录完全指南:从音频文件到可编辑字幕的5个步骤

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

花半天手动整理访谈录音,结果发现有二十分钟听错了?Buzz是一款免费开源的离线语音转录工具,基于OpenAI Whisper,在你自己的电脑上完成音频转文字和翻译。音频从不上传,断网也能转录。

这意味着隐私完全由你掌控。处理敏感录音的记者、医生、律师可以安心使用。它支持Windows、macOS和Linux三大平台。

各平台安装Buzz的5个步骤

Windows:从项目发布渠道下载安装包并双击运行。安装时会有安全警告,因为程序未签名。点击"更多信息",再点"仍要运行"即可。

macOS:下载.dmg文件,拖入应用程序文件夹。Intel和Apple Silicon的Mac都支持。

Linux:通过Flatpak安装,只需一条命令:

flatpak install flathub io.github.chidiwilliams.Buzz

Snap用户运行sudo snap install buzz也可以。想从pip安装,先装好ffmpeg,再执行pip install buzz-captions。各平台依赖详见安装文档。

三分钟完成第一次音频转文字

安装完成后,按这5步完成你的第一次转录:

  1. 打开Buzz,按Ctrl+O(macOS为Command+O),或点工具栏的"+"按钮。
  2. 选择一个音频或视频文件,MP3、WAV等常见格式都可以。
  3. 选择任务("转录"或"翻译成英语")并指定语言。官方建议明确选语言,自动检测可能不准。
  4. 选择模型类型和大小,点击"运行"。
  5. 状态显示"Completed"后,双击该行打开转录结果。

主窗口是一个任务队列,所有转录任务和进度一目了然。每个任务都能单独选择导出格式:TXT、SRT或VTT。

模型大小和类型怎么选

这是用Buzz要做的第一个决定,核心是速度和准确率的取舍。

模型大小速度准确率适用场景
tiny / base最快基础到良好快速整理、低配电脑
small中等优秀日常会议、采访
medium / large最高专业转录、高准确率需求

除大小外,还有4种Whisper实现可选。有6GB以上显存的N卡用户,推荐Faster Whisper,速度提升明显。没有N卡或Mac用户,推荐Whisper.cpp。它是C++实现,CPU上也能跑得很快,还支持Vulkan加速。

在"帮助 -> 偏好设置 -> 模型"里可以下载新模型,也可以删除不用的模型释放空间。

实时录音:会议演讲现场出文字

Buzz能把麦克风输入实时转成文字,边说边出稿。

它是什么:选麦克风、语言、模型,点"录音",句子会逐句出现在窗口里。

什么时候用:会议、讲座、路演等需要"说到即转"的场合。

怎么配置:💡 实时录音建议用Whisper.cpp,默认的Whisper模型比较吃资源。配置不高就用小模型。录音开始后还能打开"演示窗口",把实时字幕投到屏幕上。

高级偏好里还能设置"转录模式"和"静音阈值"。"追加并修正"模式会自动修正前句错误,但计算量更大,需要更好的硬件。

逐词时间戳合并成字幕

Buzz的转录结果不只是纯文本,还能变成标准字幕。

它是什么:转录查看器支持搜索、播放控制和播放速度调节。双击转录即可进入编辑。

什么时候用:给视频加字幕,或需要把文字对齐回音频时。

怎么配置:导入文件时勾选"逐词时间戳",Buzz会为每个词记录时间。之后点"调整大小"按钮,设置单条字幕最大长度,即可把逐词时间戳合并成完整的字幕行,再导出SRT或VTT。

没开逐词时间戳也能按最大长度重新合并,只是灵活度稍差。

会议录音场景:当天拿到完整纪要

场景挑战:会议长、内容多,希望散会当天就有文字纪要。

推荐参数:Whisper.cpp + small模型,明确指定语言,导出SRT。

操作步骤

  1. 在偏好设置里开启文件夹监控,指向会议录音目录,新文件自动转录。
  2. 转录完成后在查看器中快速浏览校对。
  3. 导出SRT分发给参会人。

视频字幕场景:逐词时间戳到SRT

场景挑战:给课程视频加字幕,要求字幕行短、断句自然。

推荐参数:Whisper.cpp + base或small,勾选"逐词时间戳",导出SRT。

操作步骤

  1. 导入视频文件,勾选"逐词时间戳"后运行。
  2. 打开转录,点"调整大小"。
  3. 设置最大字幕长度并启用按标点断开,导出SRT文件。

导出后的SRT可以直接导入视频编辑软件或OBS。

术语多的场景:让Whisper认对名字

场景挑战:访谈里的人名、公司名、专业术语,Whisper容易拼错。

推荐参数:medium或large模型,把术语写进"初始提示"。

操作步骤

  1. 导入时点"高级..."打开高级选项。
  2. 在"Initial prompt"里填入易错词。
  3. 运行转录,这些词的识别率会明显提升。

没有网络能用Buzz吗

可以。先在有网络的电脑上下载好所需模型,再把模型文件夹复制到离线电脑。各平台的模型都存在用户目录的缓存文件夹,"帮助 -> 偏好设置 -> 模型"里的"显示文件位置"按钮能直接打开它。

转录速度太慢怎么办

换更小的模型,或改用Whisper.cpp实现。有6GB以上显存的N卡用户,直接用Faster Whisper。更多加速建议见常见问题。

Windows安装时提示危险怎么办

安装程序未签名,系统会弹出安全提示。点"更多信息",再点"仍要运行",安装就能继续。

能用命令行批量处理吗

可以,Buzz自带命令行。例如:

buzz add -m whispercpp -s small --srt meeting.mp3

这条命令会新建一个转录任务,并自动导出SRT。完整参数见CLI文档。

写在最后

Buzz把整条离线语音转录链路搬进了你自己的电脑:导入、转录、整理字幕,全程不需要上传。如果你手头正有录音要整理,现在下载一份,完成你的第一次转录吧。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 16:31:25

基于SpringBoot的大学城信息推送平台设计与实现

1. 项目背景与意义随着高校信息化建设的不断深入,大学城内的师生、社团、商家和后勤部门之间产生了大量碎片化信息,如讲座通知、社团活动、失物招领、二手交易、校园公告等。传统的信息发布方式主要依赖公告栏、QQ群、微信群和邮件,存在信息分…

作者头像 李华
网站建设 2026/9/6 16:29:10

Vanna 2.0 实战:自然语言生成SQL

Vanna 2.0 实战:自然语言生成SQL 【免费下载链接】vanna 🤖 Chat with your SQL database 📊. Accurate Text-to-SQL Generation via LLMs using Agentic Retrieval 🔄. 项目地址: https://gitcode.com/GitHub_Trending/va/vann…

作者头像 李华
网站建设 2026/9/6 16:28:19

多智能体协作量化交易框架 TradingAgents-CN:股票多空对辩交给AI

多智能体协作量化交易框架 TradingAgents-CN:股票多空对辩交给AI 【免费下载链接】TradingAgents-CN 基于多智能体LLM的中文金融交易框架 - TradingAgents中文增强版 项目地址: https://gitcode.com/GitHub_Trending/tr/TradingAgents-CN 一只股票值不值得买…

作者头像 李华