news 2026/2/17 6:55:38

能控制计算机桌面的多模态AI agent框架

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
能控制计算机桌面的多模态AI agent框架

随着llm的能力越来越强,基于LLM的多模态AI agent框架和桌面工具越来越接近实用。

这里收集这些开源的ai agent框架和桌面助手工具。

pyautogui

pyautogui是一个能够模拟鼠标、键盘等输入操作的 Python 库,可以轻松实现自动化操作。

https://zhuanlan.zhihu.com/p/23356032557

NeoAI

NeoAI无需编写代码,让 AI 用简单的自然语言指令接管你的电脑,支持文件管理、任务自动化、定时操作和跨平台设备控制,并内置安全保护。

https://github.com/TheD0ubleC/NeoAI

OmniParser-V2

通过一句话让DeepSeek LLM控制电脑的框架。

OmniParser: Screen Parsing tool for Pure Vision Based GUI Agent

https://www.microsoft.com/en-us/research/articles/omniparser-v2-turning-any-llm-into-a-computer-use-agent/

https://github.com/microsoft/OmniParser/tree/master

PC-Agent/MobileAgent

一种能使用LLM控制桌面工作的开源工具。

https://github.com/X-PLUG/MobileAgent/tree/main/PC-Agent

https://github.com/X-PLUG/MobileAgent/tree/main

OpenCUA/CUA

一个用于构建和扩展 CUA(使用计算机的智能体)的完全开源的框架。具体来说,该框架包括:

  • 一个用于捕获人类使用计算机的演示的注释工具
  • AgentNet,首个涵盖 3 个操作系统和 200 多个应用程序/网站的大规模数据集
  • 一个将演示转化为具有长思维链推理的「状态-动作」对的工作流程

https://arxiv.org/abs/2508.09123

https://github.com/trycua/cua

https://github.com/xlang-ai/OpenCUA

https://zhuanlan.zhihu.com/p/1890889365196109726

Cradle

Cradle 是BAAI‑Agents开源的一款面向通用计算机控制(GCC)的多模态 AI Agent 框架,可以让大型多模态模型,通过截图输入和键鼠输出,像人一样使用各种软件和游戏。

  • 通用目标:支持任意本地软件(如游戏、Office、图像/视频编辑工具)

  • 多模态输入:以截图为输入,支持键盘鼠标操作输出

  • 自主能力:内置“认知反思+技能更新”模块,能不断自我优化

  • 模块化设计:兼顾高可控性和扩展性,轻松适配新环境

https://github.com/BAAI-Agents/Cradle

NeuralAgent

NeuralAgent​ 是一款革命性的桌面AI助手,真正能够在用户桌面上执行操作。

与传统AI对话系统不同,NeuralAgent能够实际控制鼠标、键盘,操作浏览器,填写表单,发送邮件,真正实现"思考即执行"的智能化体验。

https://github.com/mosdehcom/neuralagent

Open-Interpreter

Open-Interpreter是可以联网的 ChatGPT 代码解释器。

https://github.com/OpenInterpreter/open-interpreter

refernece

---

使用Python实现鼠标与键盘自动化操作:从基础到实战应用

https://zhuanlan.zhihu.com/p/23356032557

Cradle:颠覆AI Agent 操作本地软件,AI驱动的通用计算机控制框架,如何让基础模型像人一样操作你的电脑?

https://www.cnblogs.com/xiaohuatongxueai/p/19017467

港大联手月之暗面等开源OpenCUA:人人可造专属电脑智能体

https://zhuanlan.zhihu.com/p/1939274895700784967

Cua:Mac用户狂喜!这个开源框架让AI直接接管你的电脑,快速实现AI自动化办公

https://zhuanlan.zhihu.com/p/1890889365196109726

OmniParser V2: Turning Any LLM into a Computer Use Agent

https://www.microsoft.com/en-us/research/articles/omniparser-v2-turning-any-llm-into-a-computer-use-agent/

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/2/17 6:37:32

DeeplxFile终极指南:免费解锁无限制文件翻译的完整教程

DeeplxFile终极指南:免费解锁无限制文件翻译的完整教程 【免费下载链接】DeeplxFile 基于Deeplx和Playwright提供的简单易用,快速,免费,不限制文件大小,支持超长文本翻译,跨平台的文件翻译工具 / Easy-to-u…

作者头像 李华
网站建设 2026/2/7 22:23:45

Iridescent:Day27

https://blog.csdn.net/weixin_45655710?typeblog浙大疏锦行 DAY 27 函数专题2:装饰器 ps: 第一期day27对应5月16日 知识点回顾: 1.装饰器的思想:进一步复用 2.函数的装饰器写法 3.注意内部函数的返回值 作业: 编写一个装饰器logger&#x…

作者头像 李华
网站建设 2026/2/16 13:33:15

camera calibration(相机校准)

相机校准,指的是通过纠正变形强化精确测量以及估计相机的intrinsics(内在的)和extrinsics(外在的)参数。通过相机校准可以完以下功能:消除镜头变形,使用立体相机估计深度值,测量平面物体的大小,…

作者头像 李华
网站建设 2026/2/12 2:00:07

JD-GUI 完全指南:Java 反编译工具的终极使用手册

JD-GUI 完全指南:Java 反编译工具的终极使用手册 【免费下载链接】jd-gui A standalone Java Decompiler GUI 项目地址: https://gitcode.com/gh_mirrors/jd/jd-gui JD-GUI 是一款专业的 Java 反编译工具,能够将编译后的 Java 类文件和 JAR 包重新…

作者头像 李华
网站建设 2026/2/15 7:11:03

当模型预测控制遇上方向盘烫手时刻

MPCNMPC模型预测控制从原理与代码实现组合装。 MPC包括: mpc模型预测控制详细原理推导 matlab和c两种编程实现 四个实际控制工程案例: 双积分控制系统 倒立摆控制系统 车辆运动学跟踪控制系统 车辆动力学跟踪控制系统 NMPC包括: NMPC模型预测…

作者头像 李华
网站建设 2026/2/9 8:59:07

ASMR音频下载完整指南:跨平台工具使用详解

ASMR音频下载完整指南:跨平台工具使用详解 【免费下载链接】asmr-downloader A tool for download asmr media from asmr.one(Thanks for the asmr.one) 项目地址: https://gitcode.com/gh_mirrors/as/asmr-downloader 在寻找放松音频资源时,ASMR…

作者头像 李华