news 2026/9/14 4:08:13

pot-desktop 使用指南:免费划词翻译与截图 OCR 快速上手

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
pot-desktop 使用指南:免费划词翻译与截图 OCR 快速上手

pot-desktop 使用指南:免费划词翻译与截图 OCR 快速上手

【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop

你在读一份英文 PDF 论文,碰到一个生词。选中、复制、切到浏览器、找翻译站、粘贴、等结果、再切回来——文档已经滚到别的页了,刚复制的那个词,剪切板里也没了。pot-desktop 就是为这种时刻做的:一款免费开源的跨平台划词翻译与截图 OCR 软件,Windows、macOS、Linux 通吃,把“复制、切换、粘贴、等”这一整条链路压成一次按键。

从安装到出译文,三步就走完

最省事的是包管理器,一条命令的事:

# Windows winget install Pylogmon.pot # macOS brew tap pot-app/homebrew-tap && brew install --cask pot

Linux 直接装 Release 页的 deb 包,或者走 AUR 装 pot-translation。

装完它不弹窗,安安静静缩进系统托盘。接下来三步跑通:

  1. 打开设置,进翻译服务,挑一个引擎。免配置就选离线的(Ollama、系统 OCR);带 Key 栏目的,去对应平台申请一个。
  2. 到快捷键页,给“划词翻译”指定一个组合键,记牢它。
  3. 回到那份 PDF,选中一句话,按下这个键。小窗出现在光标旁,就成了。

它顶的是这几个时刻

外文卡壳的那一刻 📌

以前生词意味着:选中、复制、切窗口、开网页、粘贴、等、再切回来,还得记着“我在第几个标签页”。现在只选中、按一个键,译文就在光标旁边,源语言自动检测。它不占你现有的任何窗口,不存在“找不到原来的位置”。

内置二十多个翻译接口:Google、DeepL、百度这类商业服务,OpenAI、Gemini Pro 这类大模型,还有完全离线的 Ollama。每个引擎各自独立实现,见 翻译引擎源码。

字锁在图片里的那一刻

图片里的文字——扫描件、截图、课件——没法“划词”,因为它不是可选择的文本。这时候用截图 OCR:按下快捷键,框一块区域,图里的字就变成可编辑、可复制的文本。

再进一步,“截图翻译”识别完直接给译文,“框一下”就从一张图变成一个意思。各识别引擎的实现都在 OCR 引擎源码。

拿不准哪份译文更顺的那一刻

同一句话,不同引擎翻得往往不一样。翻译面板里可以同时开好几个引擎,同一段话并排出多份结果,扫一眼挑最顺的。面板支持深浅色主题切换。

手不想离开键盘的那一刻

不想动鼠标?按输入翻译快捷键,窗口出来,打字、回车就翻。或者打开剪切板监听:在任意软件里复制的文字,不按键自己进翻译。

读到好词不想丢的那一刻

选中的词一键导出到 Anki 或欧路词典,攒成自己的词库,不用手动再抄一遍。各生词本平台的实现在 生词本源码。

不满足于按快捷键:三个进阶口子

本地 HTTP 接口。默认监听 127.0.0.1:60828,端口可在设置里改。一条 curl 就能触发它,串进脚本或别的工具:

# 触发一次划词翻译 curl "127.0.0.1:60828/selection_translate" # 触发一次截图 OCR curl "127.0.0.1:60828/ocr_recognize"

插件系统。内置接口有限,新的翻译引擎、OCR 服务、生词本平台都能以 .potext 插件装进来,装完和内置服务一样用。想自己写一个,参考 识别服务源码 里的现有实现即可。

Wayland 兜底。Wayland 下应用内全局快捷键和内置截图不一定可靠,可以完全用系统截图工具 + 接口替代。以 Hyprland 为例,配一条绑定,按快捷键就完成“外部截图 + 识别”:

bind = ALT, X, exec, grim -g "$(slurp)" ~/.cache/com.pot-app.desktop/pot_screenshot_cut.png && curl "127.0.0.1:60828/ocr_recognize?screenshot=false"

screenshot=false表示不用软件内置截图、改用你指定的那张图,正是为绕开 Wayland 的截图限制而设计。

先说清边界,再给你三处排查点

坦白讲:绝大多数翻译和联网 OCR 需要填 API Key,只有 Ollama、系统 OCR、Tesseract.js 这类离线引擎免配置。它的核心是文本和图片,长音频、视频这类场景不适合它。

卡住了,查这三处:

  • 快捷键没反应。多半是组合键被别的软件占用;macOS 上没给辅助功能权限——到“隐私与安全性 → 辅助功能”把 pot 移除后重新添加;Wayland 下应用内快捷键本就指望不上,走上一节的系统级方案。
  • 识别率低。按内容选引擎:中文文档试百度、腾讯,英文文档用 Tesseract,中英混排选支持多语言的。截图本身要够清晰,糊掉的图换什么引擎都救不回来。
  • Windows 启动后没界面。检查是否卸载或禁用了 WebView2,装上或恢复即可。

装好它,设一个快捷键,下次读外文文档时按一下——被省掉的那些步骤有多磨人,你按一次就知道了。

【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/14 4:06:17

MuJoCo中Cassie双足机器人仿真库的部署、控制与强化学习实践

简介:面向机器人控制与仿真研究者的Cassie双足机器人MuJoCo仿真库资源,基于Agility Robotics官方开源仓库整理,专用于多关节接触动力学建模、行走与平衡控制算法验证。压缩包共62个文件、约1.47MB,以XML模型描述、STL网格、C/Pyth…

作者头像 李华
网站建设 2026/9/14 4:03:35

Python数字图像处理课设工程:OpenCV+PyQt5可调试系统

简介:这是一份面向计算机、人工智能、电子信息等专业本科生的数字图像处理课程设计实践源码,聚焦灰度变换、空域频域滤波、边缘检测、图像锐化及人脸识别等核心实验任务,兼顾教学演示与毕设开发需求。资源共38个文件,含17个Python…

作者头像 李华
网站建设 2026/9/14 4:03:22

腾讯健康医疗AI Agent:微信生态重构就医全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华