news 2026/10/9 17:04:53

免手打字全局听写:Jarvis一键语音转文字、自定义词典与听写历史实战教程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
免手打字全局听写:Jarvis一键语音转文字、自定义词典与听写历史实战教程

免手打字全局听写:Jarvis一键语音转文字、自定义词典与听写历史实战教程

【免费下载链接】jarvisA 100% private AI voice assistant that lives on your computer (works offline). Talk naturally as if Jarvis is a third person in the room, and get conversational responses. It remembers everything, knows location and time, can check the web, control Chrome, track nutrition, and more with support for unlimited MCPs / tools without context rot.项目地址: https://gitcode.com/gh_mirrors/jarvis87/jarvis

Jarvis 是一款 100% 本地运行的开源私人语音助手,它还有一个鲜为人知却极其实用的能力——全局听写(语音转文字):按住一个热键开始说话,松开后,识别出的文字会直接粘贴到你当前正在使用的任何应用里。整个过程离线完成、不经过云端,还能配合自定义词典纠正专业词、用本地大模型清理"嗯、啊、就是"这类口头语,并从系统托盘随时回看听写历史。下面是一份面向新手的完整实战教程。

一、为什么选本地语音转文字?

很多在线听写工具需要把音频传到云端,存在隐私与网络依赖问题。Jarvis 的全局听写完全不一样:

  • 🔒100% 离线:语音数据永远留在本机,识别由本地 Whisper 模型完成;
  • 🧠共享 Whisper 模型:与语音助手共用同一个语音识别模型,不额外占用内存;
  • 📋万能粘贴:文字通过剪贴板插入,任何支持Ctrl+V/Cmd+V的应用(编辑器、浏览器、聊天软件)都能用;
  • 🔇互不打架:听写期间主语音监听器自动暂停,你说的内容不会被误当成对 Jarvis 的指令。

功能规格详见 dictation.spec.md,设计文档里把每个细节都写得明明白白。

二、一键启用:设置向导里的听写模式

首次安装 Jarvis 时,设置向导内置了专门的Dictation Mode(听写模式)页面,勾选开关、选一个热键,几十秒就能完成配置:

这一页可以完成三件事:

  1. 启用听写模式(Enable dictation mode);
  2. 勾选口语词清理:用本地大模型自动删掉 "um、uh、like" 之类的口头语;
  3. 选择听写热键:下拉框提供ctrl+alt、ctrl+cmd、ctrl+shift+d、ctrl+shift四个预设。

如果不记得当时选了什么,随时可以从托盘菜单打开Settings修改(下文会讲)。

各平台的默认热键与 WisprFlow 保持一致:

平台默认热键
WindowsCtrl + Win
macOSCtrl + Option
LinuxCtrl + Alt

三、按住说话:全局听写的两种姿势

姿势一:按住录音,松开即粘贴

这是最常用的标准模式,全程只有两个动作:

  1. 按住热键→ 听到一声较高的"滴"(700 Hz 提示音),表示开始录音,桌面小脸进入 DICTATING 状态;
  2. 松开热键→ 低八度的"滴"(440 Hz)响起,Jarvis 用本地 Whisper 转写,处理完毕后文字自动粘贴进当前聚焦的应用。

桌面小脸会经历DICTATING → DICTATION_PROCESSING → IDLE三个状态,让你直观确认"说的每一句都被接收并处理了":

姿势二:双击进入免提模式

需要连续输入一大段内容时,不必一直按着热键:快速点按两下热键(每次短于 0.4 秒)即进入免提连续录音模式,之后你可以彻底腾出手来。停止方式有两种——再次按下热键,或按Escape。

两种模式走同一条后处理流水线,行为一致,切换零成本。

四、自定义词典:让专业词不再被听错

语音识别最容易翻车的地方是人名、产品名、行话——比如把 "Jarvis" 听成 "jarvice",把 "PyTorch" 听成小写连读。自定义词典就是为这准备的:

  • 在设置中以错误词 -> 正确词的格式添加规则,例如jarvice -> Jarvis、pytorch -> PyTorch;
  • 匹配是不区分大小写的整词替换,不会误伤包含该词的长单词;
  • 词典为空的条目不影响转写,文本原样通过。

词典在每次转写后、口头语清理前生效,是整个后处理流水线的第一站,规则细节可参考 dictation.spec.md 中的 Post-Processing Pipeline 一节。

五、口语词清理:一键去掉"嗯、啊、就是"

口语转文字往往自带"嗯……就是说……你知道吧"这类噪音。Jarvis 提供了可选的Filler Word Removal(口语词清理):

  • 开启后,转写文本会发送给本机 Ollama 上的聊天模型(与你给 Jarvis 配的是同一个),按提示词删除口头语但保留原意;
  • 设有 5 秒超时,一旦失败就回退到未清理的原始文本,绝不会卡住你的输入;
  • 向导页也贴心提示了代价:每次听写后约多等 1~3 秒,介意延迟可以关掉。

对经常录会议、写笔记的用户来说,这一步能显著减少事后编辑的工作量。

六、听写历史:随时回看、复制、删除

每一次成功的听写都会被自动记入历史:

从系统托盘打开Dictation History窗口,可以看到每条记录的文本、日期时间、录音时长,并支持:

  • 📋Copy:一键复制全文,方便二次粘贴或改写;
  • 🗑️Delete:删除单条记录;
  • 🧹Clear All:一键清空(有二次确认,不可恢复)。

历史以本地 JSON 文件持久化(默认路径~/.local/share/jarvis/dictation_history.json),最多保留 500 条,超出自动淘汰最旧记录。存储逻辑在 history.py 中实现,界面窗口则由 dictation_history.py 提供——数据只存在于你的电脑上,隐私优先。

七、在哪里改设置?

所有听写相关选项都集中在Settings窗口的Features分类下,无需手写配置文件:

设置项作用
Dictation Mode全局听写总开关
Dictation Hotkey热键下拉框,含免提模式提示
Filler Word Removal口语词清理开关
Custom Dictionary词典规则编辑器,wrong -> right格式

高级用户也可以直接编辑~/.config/jarvis/config.json,对应键为dictation_enabled、dictation_hotkey、dictation_filler_removal、dictation_custom_dictionary,完整说明见 CONFIGURATION.md 的 Dictation Mode 一节。热键下拉选项在 settings_window.py 中按平台构建。

八、常见问题与平台限制

  • macOS 需要授权:全局热键依赖 Accessibility(辅助功能)权限,首次使用请允许;macOS 26+(Tahoe)因 pynput 兼容性问题暂不可用听写;
  • Linux 需要 X11:Wayland 支持有限,建议 X11 会话下使用;
  • Whisper 还没加载完时:会播放"未就绪"提示音并跳过本次转写,稍后再试即可;
  • 麦克风选错设备:在 Settings 的 Voice Input 中选择正确的输入设备,多声道输入会自动混缩为单声道再转写;
  • 和助手功能冲突吗?:不会。听写引擎独立于助手流水线(无唤醒词、不走 TTS),仅会自动暂停主监听器,避免录音内容被当成指令,实现见 dictation_engine.py。

写在最后

Jarvis 的全局听写把"说话→文字"变成了和复制粘贴一样顺手的动作:按住热键、开口、松开,文字已经躺在你的光标上。配合自定义词典与口语词清理,它不再只是听写工具,而是一位懂你行话、还会帮你润色的本地速记员——而且这一切都不产生任何云端流量和订阅费用。打开设置向导的 Dictation Mode 页面,从第一个热键开始试试吧。

【免费下载链接】jarvisA 100% private AI voice assistant that lives on your computer (works offline). Talk naturally as if Jarvis is a third person in the room, and get conversational responses. It remembers everything, knows location and time, can check the web, control Chrome, track nutrition, and more with support for unlimited MCPs / tools without context rot.项目地址: https://gitcode.com/gh_mirrors/jarvis87/jarvis

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/9 17:04:39

热成像人物检测数据集:面向边缘部署的夜间鲁棒目标检测基准

简介:本资源是面向计算机视觉开发者与AI研究者的热成像人物检测专用数据集,聚焦低光、夜间及复杂环境下的目标检测与实例分割任务,特别适配YOLO系列模型训练与红外安防系统研发。数据集共606张热成像与对比视觉图像,配套606个YOLO…

作者头像 李华
网站建设 2026/10/9 17:01:52

PaddleDetection人脸检测与情绪识别模型推理实践指南

简介:面向计算机视觉开发者与研究者,该模型包基于百度飞桨PaddleDetection库构建,覆盖人脸检测与情绪识别两大任务,支持多种检测算法在复杂背景中快速定位人脸,并能基于经典卷积网络识别快乐、悲伤、愤怒、惊讶、恐惧、…

作者头像 李华
网站建设 2026/10/9 16:58:14

Python地图绘制实战:Cartopy从入门到精通

1. 为什么我劝你用Python画地图,而不是打开绘图软件很多人第一次接触地图绘制,脑子里蹦出来的工具是各种在线地图编辑器或者桌面端绘图软件。拖拖拽拽,点几下鼠标,一张图就出来了,看起来门槛极低。但只要你真正做过几个…

作者头像 李华
网站建设 2026/10/9 16:57:24

AI视频打斗戏总是翻车?6条提示词规则将崩溃率从八成压到两成

说个扎心的事实:2026年了,各家AI视频模型连几分钟的连续镜头都能生成了,但打斗戏依然是翻车重灾区。角色原地抽搐、俩人隔空互殴、一拳打出去半个人没了,这类事故我见得太多。我自己用可灵、Vidu、Seedance、Runway这几个主流工具…

作者头像 李华
网站建设 2026/10/9 16:54:35

csv文件编辑器中文版:从编码探测到流式解析的工程实践

简介:CSV文件编辑器(中文版)是一款面向中文用户、专为查看与编辑CSV数据而设计的轻量工具,适合需要处理联系人导出、应用数据迁移或跨平台表格交换的普通用户与办公人群。它针对中文环境优化,可避免Excel打开CSV时常见…

作者头像 李华
网站建设 2026/10/9 16:53:48

七自由度车辆模型全解析:从动力学方程到Python仿真

简介:面向汽车工程与智能驾驶领域的学习者及研发人员,这份资源提供一套七自由度车辆动力学仿真模型,在MATLAB Simulink环境下运行,覆盖纵向、横向、垂直、滚转、俯仰、偏航及车轮转动等核心自由度,可模拟驱动、制动、路…

作者头像 李华