免手打字全局听写:Jarvis一键语音转文字、自定义词典与听写历史实战教程
【免费下载链接】jarvisA 100% private AI voice assistant that lives on your computer (works offline). Talk naturally as if Jarvis is a third person in the room, and get conversational responses. It remembers everything, knows location and time, can check the web, control Chrome, track nutrition, and more with support for unlimited MCPs / tools without context rot.项目地址: https://gitcode.com/gh_mirrors/jarvis87/jarvis
Jarvis 是一款 100% 本地运行的开源私人语音助手,它还有一个鲜为人知却极其实用的能力——全局听写(语音转文字):按住一个热键开始说话,松开后,识别出的文字会直接粘贴到你当前正在使用的任何应用里。整个过程离线完成、不经过云端,还能配合自定义词典纠正专业词、用本地大模型清理"嗯、啊、就是"这类口头语,并从系统托盘随时回看听写历史。下面是一份面向新手的完整实战教程。
一、为什么选本地语音转文字?
很多在线听写工具需要把音频传到云端,存在隐私与网络依赖问题。Jarvis 的全局听写完全不一样:
- 🔒100% 离线:语音数据永远留在本机,识别由本地 Whisper 模型完成;
- 🧠共享 Whisper 模型:与语音助手共用同一个语音识别模型,不额外占用内存;
- 📋万能粘贴:文字通过剪贴板插入,任何支持
Ctrl+V/Cmd+V的应用(编辑器、浏览器、聊天软件)都能用; - 🔇互不打架:听写期间主语音监听器自动暂停,你说的内容不会被误当成对 Jarvis 的指令。
功能规格详见 dictation.spec.md,设计文档里把每个细节都写得明明白白。
二、一键启用:设置向导里的听写模式
首次安装 Jarvis 时,设置向导内置了专门的Dictation Mode(听写模式)页面,勾选开关、选一个热键,几十秒就能完成配置:
这一页可以完成三件事:
- 启用听写模式(Enable dictation mode);
- 勾选口语词清理:用本地大模型自动删掉 "um、uh、like" 之类的口头语;
- 选择听写热键:下拉框提供
ctrl+alt、ctrl+cmd、ctrl+shift+d、ctrl+shift四个预设。
如果不记得当时选了什么,随时可以从托盘菜单打开Settings修改(下文会讲)。
各平台的默认热键与 WisprFlow 保持一致:
| 平台 | 默认热键 |
|---|---|
| Windows | Ctrl + Win |
| macOS | Ctrl + Option |
| Linux | Ctrl + Alt |
三、按住说话:全局听写的两种姿势
姿势一:按住录音,松开即粘贴
这是最常用的标准模式,全程只有两个动作:
- 按住热键→ 听到一声较高的"滴"(700 Hz 提示音),表示开始录音,桌面小脸进入 DICTATING 状态;
- 松开热键→ 低八度的"滴"(440 Hz)响起,Jarvis 用本地 Whisper 转写,处理完毕后文字自动粘贴进当前聚焦的应用。
桌面小脸会经历DICTATING → DICTATION_PROCESSING → IDLE三个状态,让你直观确认"说的每一句都被接收并处理了":
姿势二:双击进入免提模式
需要连续输入一大段内容时,不必一直按着热键:快速点按两下热键(每次短于 0.4 秒)即进入免提连续录音模式,之后你可以彻底腾出手来。停止方式有两种——再次按下热键,或按Escape。
两种模式走同一条后处理流水线,行为一致,切换零成本。
四、自定义词典:让专业词不再被听错
语音识别最容易翻车的地方是人名、产品名、行话——比如把 "Jarvis" 听成 "jarvice",把 "PyTorch" 听成小写连读。自定义词典就是为这准备的:
- 在设置中以
错误词 -> 正确词的格式添加规则,例如jarvice -> Jarvis、pytorch -> PyTorch; - 匹配是不区分大小写的整词替换,不会误伤包含该词的长单词;
- 词典为空的条目不影响转写,文本原样通过。
词典在每次转写后、口头语清理前生效,是整个后处理流水线的第一站,规则细节可参考 dictation.spec.md 中的 Post-Processing Pipeline 一节。
五、口语词清理:一键去掉"嗯、啊、就是"
口语转文字往往自带"嗯……就是说……你知道吧"这类噪音。Jarvis 提供了可选的Filler Word Removal(口语词清理):
- 开启后,转写文本会发送给本机 Ollama 上的聊天模型(与你给 Jarvis 配的是同一个),按提示词删除口头语但保留原意;
- 设有 5 秒超时,一旦失败就回退到未清理的原始文本,绝不会卡住你的输入;
- 向导页也贴心提示了代价:每次听写后约多等 1~3 秒,介意延迟可以关掉。
对经常录会议、写笔记的用户来说,这一步能显著减少事后编辑的工作量。
六、听写历史:随时回看、复制、删除
每一次成功的听写都会被自动记入历史:
从系统托盘打开Dictation History窗口,可以看到每条记录的文本、日期时间、录音时长,并支持:
- 📋Copy:一键复制全文,方便二次粘贴或改写;
- 🗑️Delete:删除单条记录;
- 🧹Clear All:一键清空(有二次确认,不可恢复)。
历史以本地 JSON 文件持久化(默认路径~/.local/share/jarvis/dictation_history.json),最多保留 500 条,超出自动淘汰最旧记录。存储逻辑在 history.py 中实现,界面窗口则由 dictation_history.py 提供——数据只存在于你的电脑上,隐私优先。
七、在哪里改设置?
所有听写相关选项都集中在Settings窗口的Features分类下,无需手写配置文件:
| 设置项 | 作用 |
|---|---|
| Dictation Mode | 全局听写总开关 |
| Dictation Hotkey | 热键下拉框,含免提模式提示 |
| Filler Word Removal | 口语词清理开关 |
| Custom Dictionary | 词典规则编辑器,wrong -> right格式 |
高级用户也可以直接编辑~/.config/jarvis/config.json,对应键为dictation_enabled、dictation_hotkey、dictation_filler_removal、dictation_custom_dictionary,完整说明见 CONFIGURATION.md 的 Dictation Mode 一节。热键下拉选项在 settings_window.py 中按平台构建。
八、常见问题与平台限制
- macOS 需要授权:全局热键依赖 Accessibility(辅助功能)权限,首次使用请允许;macOS 26+(Tahoe)因 pynput 兼容性问题暂不可用听写;
- Linux 需要 X11:Wayland 支持有限,建议 X11 会话下使用;
- Whisper 还没加载完时:会播放"未就绪"提示音并跳过本次转写,稍后再试即可;
- 麦克风选错设备:在 Settings 的 Voice Input 中选择正确的输入设备,多声道输入会自动混缩为单声道再转写;
- 和助手功能冲突吗?:不会。听写引擎独立于助手流水线(无唤醒词、不走 TTS),仅会自动暂停主监听器,避免录音内容被当成指令,实现见 dictation_engine.py。
写在最后
Jarvis 的全局听写把"说话→文字"变成了和复制粘贴一样顺手的动作:按住热键、开口、松开,文字已经躺在你的光标上。配合自定义词典与口语词清理,它不再只是听写工具,而是一位懂你行话、还会帮你润色的本地速记员——而且这一切都不产生任何云端流量和订阅费用。打开设置向导的 Dictation Mode 页面,从第一个热键开始试试吧。
【免费下载链接】jarvisA 100% private AI voice assistant that lives on your computer (works offline). Talk naturally as if Jarvis is a third person in the room, and get conversational responses. It remembers everything, knows location and time, can check the web, control Chrome, track nutrition, and more with support for unlimited MCPs / tools without context rot.项目地址: https://gitcode.com/gh_mirrors/jarvis87/jarvis
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考