pot-desktop 使用指南:跨平台划词翻译与截图 OCR 的终极效率工具
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognize.项目地址: https://gitcode.com/pot-app/pot-desktop
凌晨两点,一篇 40 页的英文论文摊在眼前。光标扫过生词、按下快捷键,翻译窗口贴着鼠标弹出——没有切窗口、没有复制粘贴、没有打开网页翻译。这正是pot-desktop(Pot)划词翻译软件在无数个类似场景里做的事:把「选中文字」和「看到译文」之间的时间差压缩到一次按键。作为基于 Tauri 构建的跨平台工具,它同时覆盖 Windows、macOS 与 Linux 三大桌面系统,内置 20+ 翻译接口、10+ 文字识别服务,并支持截图 OCR、剪贴板监听、生词本导出与外部调用,是当前桌面端翻译场景覆盖最完整的开源方案之一。
三种主题下的翻译窗口,同一段文本可同时对比 OpenAI、谷歌、火山等多个引擎的译文结果。
它到底解决了什么:被忽略的「翻译打断成本」
传统翻译流程的代价从来不只是「慢」,而是频繁的上下文切换:
- 切换成本:划词 → 复制 → 切到浏览器 → 粘贴 → 等待加载 → 切回原页面,一条 5 秒的链路被拆成 6 次打断,阅读节奏彻底崩坏。
- 单引擎局限:默认翻译对专业术语与语境经常「答非所问」,想横向对比多家结果,只能逐个网站手动刷新,费时且无法直接比对。
- 图像盲区:PDF 扫描件、产品截图、公式排版里的文字,纯文本翻译工具完全束手无策,需要另开 OCR 工具二次搬运。
pot-desktop 把这三件事收进同一套快捷键体系:翻译、OCR、生词本、语音合成全部在原生窗口内完成,用户全程无需离开正在阅读的文档。
三分钟完成安装与首次配置
安装路径按平台选择即可,全程无需命令行基础:
- Windows:在包管理器执行
winget install Pylogmon.pot,或下载x64/x86/arm64对应的exe安装包双击安装。 - macOS:执行
brew tap pot-app/homebrew-tap && brew install --cask pot,或下载dmg拖入 Applications(M1 芯片选择aarch64版本)。 - Linux:Debian/Ubuntu 用
sudo apt-get install ./pot_{version}_amd64.deb,Arch 系可用yay -S pot-translation,也支持 Flatpak 安装。
装好之后只做三件事即可开箱使用:在偏好设置里绑定划词翻译快捷键、勾选常用的 2-3 个翻译引擎作为默认、打开剪贴板监听开关。整个配置过程不超过三分钟,之后所有翻译都无需再碰设置页。
六种触发方式:把翻译变成肌肉记忆
pot-desktop 的过人之处在于不只有一种入口,六种触发方式覆盖了从阅读、写作到截图的全部场景:
| 触发方式 | 操作方式 | 典型场景 |
|---|---|---|
| 划词翻译 | 选中文本 + 快捷键 | 阅读网页、文档、PDF |
| 输入翻译 | 快捷键呼出输入框,回车即译 | 写作润色、术语查询 |
| 剪贴板监听 | 开启后自动翻译复制内容 | 批量处理、串行阅读 |
| 截图 OCR | 框选区域识别文字 | 扫描件、图片、界面文字 |
| 截图翻译 | 框选区域直接出译文 | 漫画、海报、产品图 |
| 外部调用 | HTTP 接口远程触发 | 集成进 IDE、脚本、工作流 |
其中截图翻译对普通用户的价值常被低估:漫画生肉、外文海报、软件界面截图,框一下就直接得到译文,等于把 OCR 和翻译合并成了一次操作。
一条完整工作流:从生词到记忆卡片
把多项能力串联起来,pot-desktop 就不再是翻译工具,而是一套语言学习流水线:
翻译结果自带发音、复制与收藏按钮,生词可直接推送到 Anki 或欧路词典生成卡片,省掉了「抄单词 → 手动建卡」的重复劳动。
三个真实场景:痛点与解法
场景一:学术文献阅读
痛点:论文里的专业术语机翻生硬,扫描版 PDF 无法复制文字,公式图片更无从下手。
解决方案:先用截图 OCR 把扫描段落提成文本(Linux 下可用系统 Tesseract 离线识别),再用 AI 类引擎(OpenAI、智谱、Gemini Pro)做语境化翻译;遇到复杂公式用 Simple LaTeX 识别插件直接转 LaTeX 源码;高频生词一键收藏,事后统一同步到 Anki 生成记忆卡片,阅读与背词形成闭环。
场景二:跨境电商运营
痛点:商品标题、买家留言、竞品描述混杂多种语言,营销文案直译后失去本地化语感,配图文字处理更是低效。
解决方案:开启剪贴板监听后,复制什么就自动翻译什么,商品描述批量过火山的营销向引擎;平台内买家消息用 Google 与 DeepL 双引擎对比,避免单一引擎误译;商品截图走腾讯图片翻译批量提取图内文字,再统一润色,一个人也能维持多语言店铺的运营节奏。
场景三:把翻译写进自己的工作流
痛点:IDE、脚本、内部工具里遇到的报错信息,无法直接调用翻译软件,只能手动复制到外部。
解决方案:pot-desktop 内置 HTTP 服务(默认端口60828),一行curl "127.0.0.1:60828/selection_translate"即可远程触发划词翻译,/ocr_translate触发截图翻译。开发者可以把它绑进编辑器快捷键、接入自动化脚本,甚至替换为自己的截图工具再调用 OCR——这也是它与「纯图形界面翻译工具」最本质的差异。
与同类工具的横向对比
| 对比维度 | pot-desktop | 传统桌面翻译软件 | 浏览器翻译插件 |
|---|---|---|---|
| 跨平台支持 | Windows / macOS / Linux | 通常仅限单一平台 | 仅限浏览器内 |
| 翻译接口数量 | 20+ 内置 + 插件扩展 | 固定 3-5 个 | 单引擎或少量 |
| 截图 OCR / 截图翻译 | 原生支持,含离线方案 | 多数不支持 | 不支持 |
| 系统资源占用 | 约 100MB(Tauri 构建) | 普遍 200MB+ | 常驻后台持续占内存 |
| 离线可用性 | 系统 OCR + Tesseract.js + Ollama | 依赖云端 | 完全依赖网络 |
| 生词本联动 | Anki / 欧路 / 有道 / 扇贝 | 较少内置 | 无 |
| 外部调用 API | 完整 HTTP 接口 | 基本没有 | 无 |
离线与隐私:敏感文本不出本机
对涉及隐私或断网环境的用户,pot-desktop 提供了一条完整的离线链路:
- 离线 OCR:Windows 走 Windows.Media.OCR、macOS 走 Vision Framework、Linux 走 Tesseract,系统级识别无需上传图片;另有 Tesseract.js 与 RapidOCR、PaddleOCR 离线插件可选。
- 离线翻译:接入本地 Ollama 模型即可完全脱离云端;敏感合同、内部文档可以全程在本机完成识别与翻译。
- 本地词库:ECDICT 离线词典插件让查词也不依赖网络。
需要强调:离线引擎的优先级是可以配置的,把系统 OCR 设为默认后,日常截图识别默认不再触碰云端,只有明确选择云服务时数据才会外传。
常见疑问答疑(FAQ)
Q1:划词翻译没反应,可能是什么原因?macOS 需在「系统设置 → 隐私与安全性 → 辅助功能」中授权 pot(可尝试移除后重新添加);Windows 需确认 WebView2 运行时存在;Linux Wayland 桌面下应用内快捷键默认不可用,需借助系统快捷键发送 HTTP 请求触发。
Q2:Linux 下启动即崩溃怎么办?新版本 WebKitGTK(2.42.0 及以上)在 Nvidia 专有驱动下存在 DMABUF 兼容问题,在环境变量中加入WEBKIT_DISABLE_DMABUF_RENDERER=1即可恢复稳定。
Q3:想完全离线使用,该怎么搭配?翻译引擎选 Ollama 本地模型,OCR 选系统引擎或 Tesseract.js,词典挂 ECDICT 插件,即可做到「断网可翻译、可识别、可查词」。
Q4:插件如何安装?下载.potext扩展文件后,在「偏好设置 → 服务设置 → 添加外部插件」中选择该文件即可安装,之后它会像内置服务一样出现在服务列表中。
避坑清单:平台适配、性能、安全与故障排查
- Windows 平台:若启动后无界面且托盘无反应,优先检查 WebView2 是否被卸载或禁用;企业版无法安装时可改用内置 WebView2 运行时的安装包。
- macOS 平台:首次打开提示「开发者无法验证」时,在隐私与安全性中点击「仍要打开」;若提示文件损坏,执行
sudo xattr -d com.apple.quarantine /Applications/pot.app后重启即可。 - 性能优化:在服务设置中关闭不常用的翻译引擎,减少无效请求与内存驻留;日常截图识别优先选择系统内置 OCR,速度与资源占用都优于云端接口。
- 安全提示:第三方 API 务必配置用量限制与密钥保护,避免密钥泄露导致额度滥用;处理敏感文档时切换到离线引擎,确保内容不出本机。
- 故障排查:截图功能异常时尝试关闭硬件加速;插件报「找不到指定的模块」需安装 VC++ 运行库;报「不是有效的 Win32 应用程序」则说明插件架构与系统不匹配,需重新下载对应架构版本。
- Wayland 用户:纯 Wayland 桌面(如 Hyprland)下内置截图不可用,可用 grim + slurp 等外部截图工具配合
screenshot=false参数调用;窗口跟随鼠标可借助窗口规则实现(仓库的 patches/hyprland.patch 提供了现成参考)。
想自己编译一份?
环境要求 Node.js ≥ 18、pnpm ≥ 8.5、Rust ≥ 1.80,克隆仓库后依次执行pnpm install(Linux 需先安装 WebKitGTK 等系统依赖)、pnpm tauri dev即可进入开发调试,pnpm tauri build产出安装包:
git clone https://gitcode.com/pot-app/pot-desktop模块化的服务接入架构,使新翻译引擎的接入周期可以缩短到 1-2 天,这也是它插件生态能持续膨胀的根本原因。
结语:翻译工具的下一站是「工作流组件」
pot-desktop 经过 20+ 个版本迭代,已经从「划词翻译器」长成了覆盖翻译、OCR、生词本、语音合成、外部调用的桌面语言服务中枢。它最值得关注的方向,是插件生态与 HTTP 接口带来的组合能力——当翻译可以被任意程序调用、可以被任意插件扩展时,它的上限就不再由官方功能表决定,而是由使用者的想象力决定。无论你是学生、跨境运营还是开发者,都值得把它放进常驻工具栏,然后忘掉「翻译」这件事本身。
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognize.项目地址: https://gitcode.com/pot-app/pot-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考