离线语音转文字实测:24 种语言、5 倍实时速度,Handy 凭什么断网也能出字
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
飞机刚进入平飞,我对着笔记本口述了一整段采访提纲。降落时打开备忘录,那段话已经整整齐齐躺在里面——全程没连过一次网。让"说话自动变成文字"脱离云端的,是一款叫 Handy 的开源桌面应用:完全离线的语音转文字,录音、识别、文本生成全部在本机完成。它为什么敢断网干活?普通人又该怎么把它用起来?这篇笔记按"原理—上手—亮点—场景"的顺序拆给你看。
它怎么在断网时听懂人话的 🎙️
很多人第一次听到"离线语音识别",会下意识以为是个缩水版。其实 Handy 的思路恰恰相反:它把整套识别引擎搬进了你的电脑,而不是从云端"借"算力。
流程很短:按下快捷键开始录音 → 说话 → 松手 → 文字自动出现在光标所在的位置。其中有两个细节值得单独拎出来:
- 静音是"剪"掉的。录音过程中,Silero 语音活动检测(VAD)会实时判断哪些片段是有效语音,把停顿、吸气、背景噪声滤掉,交给识别器的都是"干货",既省算力也省时间。
- 模型是可以选的。默认提供 Whisper 家族(Small / Medium / Turbo / Large),有 GPU 时自动加速;另有一个专为 CPU 优化的 Parakeet V3,最低只需要 6 代酷睿,官方在 i5 上测出约 5 倍实时速度,还自带自动语言检测——不用手动指定语种。
0.9.0 版本之后,主引擎换成了 transcribe.cpp,最直观的变化是支持流式模型:像 Parakeet Unified(面向英语)、Nemotron Streaming 3.5(面向多语言)这类模型,文字会随着你的语速"边读边出",而不是等一句话说完才整体蹦出来。⚡
从装好到第一次出字,大概一首歌的时间
上手不需要动代码。装好后给它麦克风权限和辅助功能权限,设一个顺手的快捷键,第一次录音时它会提示下载模型,之后就进入了"按一下、说一句、出字"的循环。
- macOS:
brew install --cask handy - Windows:
winget install cjpais.Handy - 其他平台:从发布页下载对应系统的安装包
想从源码构建也不难,环境准备好后几条命令即可:
git clone https://gitcode.com/GitHub_Trending/handy11/Handy cd Handy npm install npm run tauri dev如果你习惯命令行,它还暴露了一组远程控制参数:--toggle-transcription开关录音、--cancel取消当前操作、--start-hidden静默启动。这些参数在 Wayland 桌面环境里尤其好用——系统快捷键没法直接联动应用时,把快捷键指向这条命令就行。调试模式也随时可用:macOS 按Cmd+Shift+D,Windows/Linux 按Ctrl+Shift+D,里面能看到完整日志和路径信息。
那些把"能用"变成"好用"的开关 🧩
默认配置已经能干活,但 Handy 的真正乐趣藏在设置里。src/components/settings/目录下挂着几十个开关,挑几个我日常用得最多的:
流式覆盖层。用流式模型时,屏幕角落会出现一个半透明小窗,你正在说的话实时变成文字显示在上面,边说边确认,说错了当场改口重说。
Push-to-talk 模式🎤。按住快捷键说话、松开即停,适合不想让录音一直挂着的人;配合音频反馈音,能清楚判断当前是否在录。
自定义词汇表。专业术语、人名、产品名反复识别错?在"自定义词汇"里加进去,之后命中率明显提升。转录文本还能做后处理:过滤"嗯""那个"这类填充词、补上标点、甚至接入 OpenAI 兼容接口(自定义 Base URL 加 API Key,macOS 上还能用 Apple Intelligence)让文字更通顺。
多语言与多模型。界面和识别一起覆盖 24 种语言,阿拉伯语、希伯来语这类从右往左的文字也做了适配。除了内置模型,把社区训练好的 Whisper GGML 模型丢进数据目录的models文件夹,重启后就会出现在"自定义模型"里——扩展性这件事,它是认真的。
真实场景:把一场评审会说成纪要 📝
每周五的产品评审会,我现在的做法是:开着 Handy,用 Push-to-talk 在自己发言时按住快捷键,别人说话时松开。散会后,我口述一段"今天的结论是……",几秒钟内就能得到一份结构化的纪要草稿,稍作整理就能发出去。手不用离开桌面,眼睛也不用在窗口之间来回跳。
对打字困难或视力障碍的用户,这个"说话即输入"的能力价值更大——它本质上是一条不依赖键盘的输入通道,而且所有识别都在本地完成,敏感内容不会经过任何服务器,这也正是它把"离线"当卖点而非妥协的原因。
踩坑清单:提前替你填平的几个坑 ⚠️
- 麦克风没声音:先查系统隐私设置里的麦克风权限,再确认没有其他应用独占设备。
- 识别率不理想:换更大的模型试试;排查环境噪音;如果专业词多,先更新自定义词汇表。
- Linux 上文字粘贴不进去:X11 装
xdotool,Wayland 装wtype或dotool,这是文本输入的底层依赖,README 里有完整的对照表和配置说明。 - 网络受限、模型下载不了:直接用浏览器下载模型文件,手动放进数据目录的
models文件夹,重启即可识别;目录结构和命名规则见 README.md 的 Troubleshooting 一节。 - macOS 蓝牙耳机录音时音质下降:这是蓝牙双向音频的固有限制,输出保持耳机、输入改用 Mac 内置麦克风即可。
它不是最强的,却是最容易被 fork 的
Handy 的自我定位很有意思,项目 README 里写得很直白:它没打算做"最好"的语音转文本应用,而是想做"最容易被 fork 的那一个"。代码基于 MIT 协议开源,前端是 React + TypeScript,后端是 Rust(Tauri 框架),核心处理逻辑集中在src-tauri/src/——想自己加功能、换模型、接插件,都有清晰的下手点。社区也已经为它做了 Raycast 扩展,能在启动器里直接开关录音、翻转录历史。
下次你需要"把话变成字",又不想让任何一句私密内容离开电脑时,不妨试试它。先装好,再花几分钟调一调快捷键和模型,然后你就会发现:断网,从来不是语音输入的天花板。
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考