opengui

一个让AI智能体在真实Android设备上“看见”并操作移动应用界面的框架。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:opengui。
它的用途是:一个让AI智能体在真实Android设备上“看见”并操作移动应用界面的框架。
完整的 Skill 内容见:https://321skill.com/skills/opengui/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“阅读 `./skills/open-gui-bootstrap/SKILL.md` 并帮我运行OpenGUI,只询问我需要在手机端进行的操作。” 它会引导你完成从环境检查、依赖安装、服务启动到手机客户端配置的全过程。之后,你可以通过CLI命令 `pnpm opengui -- do '在微信中搜索OpenAI的最新消息'` 来让AI智能体操作你的手机完成这个任务。

介绍

OpenGUI 解决了AI智能体无法直接与真实移动应用界面交互的难题。它提供了一个完整的Android GUI代理栈,使AI能够读取屏幕内容、理解界面元素、规划操作步骤(如点击、滑动、输入),并在真实设备或模拟器上执行这些操作,最终返回结构化的结果。

使用OpenGUI,开发者或用户可以通过命令行、REST API或Discord频道向AI智能体发送任务指令,例如“在微博上搜索某个话题并截图”。框架的后端负责协调视觉语言模型进行屏幕理解与任务规划,并通过安装在Android设备上的客户端执行具体的界面操作。

它非常适合希望探索移动端自动化、构建Android应用测试智能体,或研究多模态AI在真实物理设备上应用场景的开发者、研究人员和智能体爱好者。

需要注意的是,使用前需准备好Android设备(需开启USB调试和辅助功能权限)、相应的模型API密钥(如Claude、Qwen等),并按照文档进行环境配置。对于复杂的商业应用场景,需考虑其执行可靠性和对特定应用界面的适配程度。

核心特点

与同类基于模拟器或固定脚本的移动自动化工具不同,OpenGUI深度融合了视觉语言模型(VLM),使AI能真正“看懂”实时屏幕并做出决策,支持长达12小时的复杂任务链。同时,它提供了从本地CLI、REST API到Discord频道的多种任务分发方式,并设计了专门的Skill让Claude Code或Codex等编码智能体能够直接引导用户完成整个搭建过程。

注意事项

目前主要专注于Android平台,且执行复杂任务的稳定性和成功率高度依赖于VLM对特定应用界面的识别准确度。

常见问题

OpenGUI需要Root手机吗?

不需要Root,但需要在Android设备上开启开发者选项中的USB调试和系统辅助功能(AccessibilityService)。

可以用iOS设备吗?

目前不支持iOS,它是一个专门针对Android平台的GUI代理框架。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/opengui/raw/index.md 读取 opengui 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。