OmniParser 纯视觉屏幕解析工具:4 步把任意截图变成 AI Agent 能“看懂“的点击地图

发布时间:2026/9/5 22:18:33
OmniParser 纯视觉屏幕解析工具:4 步把任意截图变成 AI Agent 能“看懂“的点击地图 OmniParser 纯视觉屏幕解析工具4 步把任意截图变成 AI Agent 能看懂的点击地图【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser让 AI 帮你点鼠标最大的障碍不是模型不够聪明而是它看不懂屏幕。OmniParser 就是一个纯视觉的屏幕解析工具给它一张 GUI 截图它会框出所有可交互元素、读出屏幕上的文字、给每个图标配上描述最终输出一张带编号的标注图和一份结构化清单。你不需要去扒网页 DOM也不需要写一堆坐标选择器AI Agent 拿到这份清单就能精准落到该点的位置上。为什么 AI Agent 看屏幕绕不开纯视觉这条路以前想让程序操作界面常见做法是依赖接口网页靠 DOM 树桌面应用靠控件树游戏就更简单了——找内存、挂钩子。问题是这些接口都很脆版本一升级、主题一换、渲染引擎一迁移选择器就全失效了点击要么落空要么误触。OmniParser 换了个思路不碰任何内部结构只看像素。就像你自己用电脑一样眼睛扫一遍界面心里已经知道哪里是按钮、哪里是菜单。工具的核心代码在 util/omniparser.py输入就是一张图输出就是结构化结果。游戏更新换皮、软件改了布局只要东西在画面上还长那样解析照样成立。这也是它能被拿去做纯视觉 GUI Agent地基的原因——Agent 看到的永远是屏幕本身。上传一张截图你会得到一张带编号的屏幕地图先看效果。随便截一张桌面或网页的图扔给它输出有两部分左边是叠加了编号框的图这种Set-of-Mark编号法是 Agent 常用技巧给每个可点元素标个号模型说点 3执行器就知道对应哪个框右边是逐条的文字描述每个元素带上编号、描述、位置信息。对模型来说界面从一团像素变成了可枚举、可指代的列表把第三个按钮点一下这种指令就能可靠落地了。快速上手 OmniParser从克隆仓库到看到解析结果的 4 条命令整个流程不复杂仓库里给了现成的 Gradio 演示界面git clone https://gitcode.com/GitHub_Trending/omn/OmniParser cd OmniParser pip install -r requirements.txt python gradio_demo.py建议按 README 的说法用 Python 3.12 的 conda 环境conda create -n omni python3.12再激活。装好后打开演示页面左边上传截图右边就能出结果。界面上还有几个滑块可以调Box Threshold 控制过滤低置信度框IOU Threshold 控制重叠框去重还能切换是否用 PaddleOCR、调整检测输入分辨率。想跳过界面直接看代码示例的话仓库根目录的 demo.ipynb 里放了几组简单用例照着跑一遍比读文档直观。一张截图如何变成结构化元素检测、OCR、图标描述三步配合拆开看解析其实是三条流水线并联再合并逻辑集中在 util/utils.py可交互区域检测用 YOLOv9 系列的检测模型仓库内的 util/yolov9.py 就是检测器封装找出按钮、输入框、图标这些能被点的区域。2026 年 7 月项目还新增了 YOLOv9-E 交互区域检测器对更小、更细的图标也更稳。文字识别EasyOCR 或 PaddleOCR 把屏幕上的文本读出来并给出位置让这个按钮写着什么不再是猜测。图标描述对没有文字的图标用一个视觉描述模型默认 Florence-2生成一句人话比如播放、购物车。V1.5 之后还会判断每个元素是否可交互。三路结果按位置做重叠合并去掉互相包含的冗余框最后统一编号输出。V2 版本比 V1 快了 60% 左右并且认识更多系统级和应用内的图标在 ScreenSpot Pro 这个较新的 GUI 定位基准上V2 拿到 39.5% 的成绩评测脚本和结果都放在 eval/ 目录方法细节见 docs/Evaluation.md。从一张截图到整台 Windows 系统OmniTool 的组合玩法单张截图的解析只是起点。仓库里的 omnitool/ 把整套东西组装成了能真正动手的系统三个组件各司其职omniparserserverFastAPI 服务把 OmniParser V2 包成接口适合放到 GPU 机器上跑得快一点omnibox一个跑在 Docker 容器里的 Windows 11 虚拟机基于 KVM预留 30GB 空间负责真正执行鼠标键盘操作gradio UI你在浏览器里下指令Agent 的推理过程和 VM 里的实际执行都能实时看到。模型可以自选OpenAI 的 4o/o1/o3-mini、DeepSeek R1、Qwen 2.5VL或 Anthropic 的 Computer Use 都开箱可用。多窗口、多应用的复杂场景下参考 imgs/windows_multitab.png 这类多标签界面解析和定位都能正常工作。具体搭建步骤、常见报错比如 VM 没启动完导致Windows Host is not responding在 omnitool/readme.md 里写得比较细。不止演示界面自动化测试、办公场景与 Agent 训练数据这类工具的价值在于屏幕理解本身是可复用的。几个实际能落的方向自动化测试不写脆弱选择器直接对着界面截图做回归验证界面改版后用例还能活办公与日常软件操作Word、Excel、OneNote、Teams 这类 Office 场景仓库在 imgs/ 里放了 word.png、onenote.png、teams.png 等样例都能解析成同样格式的元素列表方便做数据提取给自家 Agent 造数据2025 年 3 月起项目支持本地记录操作轨迹trajectory配合 OmniTool 就能在自己业务域里攒一套截图 解析 动作的训练数据流水线。对新手来说还有一条隐藏福利整个解析过程是完全白盒的——检测、去重、描述每一步都能单独看拿它来理解视觉 Agent 是怎么看屏幕的比啃论文快得多。适合谁怎么试如果你在做 GUI Agent、自动化测试或者只是想搞懂让 AI 看懂屏幕到底需要什么OmniParser 值得花一个下午先跑python gradio_demo.py看单图解析觉得够了就停在 demo.ipynb 里把参数玩熟要进一步让 Agent 真操作电脑再按 omnitool/readme.md 把 Windows 虚拟机那套搭起来。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考