不写一行 XPath,只用一句人话操作界面:UI-TARS 视觉 GUI 自动化快速上手指南

发布时间:2026/9/15 11:51:18
不写一行 XPath,只用一句人话操作界面:UI-TARS 视觉 GUI 自动化快速上手指南 不写一行 XPath只用一句人话操作界面UI-TARS 视觉 GUI 自动化快速上手指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS你写的自动化脚本昨天还稳今天 App 一升级就集体罢工——按钮的 resource-id 换了XPath 对不上重新定位又是一整天。UI-TARS 换了个思路它不读控件树只盯着屏幕截图看你用一句人话下指令它自己决定点哪、输什么、滚多少。下面按是什么—省什么—怎么跑—坑在哪讲清楚。30秒看懂UI-TARS 视觉 GUI 自动化是什么UI-TARS 是字节跳动开源的原生 GUI Agent底座是一个视觉语言模型基于 Qwen2-VL 微调。它把过去要拆成好几块模块干的活儿——感知屏幕、推理下一步、定位坐标、记住历史——打包进一个模型里输入一张截图加一句任务输出一行思考 动作。它不挑平台桌面Windows/macOS/Linux、手机Android 模拟器、网页共用一套动作空间比如 click、type、scroll、hotkey。这个仓库里真正能直接上手的其实是两样东西一份部署指南和一个叫 ui-tars 的 Python 后处理包负责把模型吐出来的动作串翻译成能跑的 pyautogui 代码。它替谁省了什么时间最直接受益的是天天被界面一改脚本全废折磨的人测试工程师回归用例不再为每个元素写脆弱定位界面换了 UI-TARS 靠看懂画面继续点想自动化的非程序员不用啃 Appium 的 DSL一句自然语言就能描述任务做跨端复用的团队同一套 Agent 逻辑桌面跑得到、手机也跑得到。它不是来取代 Appium 的而是给界面经常变、控件不标准的场景多一条更稳的路。一个模型同时会看、想、做UI-TARS 的卖点是把四件事塞进一个 VLM而不是像老框架那样OCR → 规则 → 定位层层转手、误差层层放大感知读图里的元素、做密集描述、判断当前界面状态推理先想后做支持多步规划与出错回退也就是系统 2式思考动作跨平台统一动作空间桌面有 hotkey手机有 open_app、press_back记忆短期记任务上下文长期记历史交互。这套结构带来的成绩官方 UI-TARS-1.5手机基准 Android World 64.2上一代 SOTA 59.5电脑基准 OSWorld 42.5上一代 38.1网页定位 ScreenSpotPro 61.6上一代 43.6。数字说明它看得准、点得对但离生产级的稳定还有一段距离。最快上手部署 第一步动作分两步。先让模型能跑云端或本地 vLLM7B 建议 L40S/A100 级显卡本地需 vllm≥0.6.1再跑后处理。后处理才是这个仓库的主菜from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code response Thought: 点搜索框\nAction: click(start_box(100,200)) w, h 1920, 1080 d parse_action_to_structure_output( response, factor1000, origin_resized_heighth, origin_resized_widthw, model_typeqwen25vl) print(parsing_response_to_pyautogui_code(d, h, w))这段代码做了什么把模型输出的思考 动作字符串解析成结构化动作换算坐标后生成一段能直接执行的 pyautogui 脚本。装包一条pip install ui-tars即可需要示例数据和提示词就git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS模板都在 codes/ui_tars/prompt.py 里。和 Appium 这类老工具到底差在哪核心差别在怎么定位元素维度Appium / EspressoUI-TARS定位依据控件树resource-id / XPath屏幕截图的像素坐标界面改版定位即失效需重写视觉理解抗一定程度的改版非标准控件常识别不到图上看得见的就能点上手成本要会写脚本和 DSL一句自然语言稳定性命中后很确定有幻觉可能点偏一句话老工具准但脆视觉 Agent稳但有概率性。两者是互补关系不是一刀切替代。动手前先避开这几个坑⚠️坐标别硬套。模型输出的是相对坐标÷1000 空间且截图会被 smart_resize 到 28 的整数倍所以原始宽高和喂给模型的宽高不是一回事。用 ui-tars 包 封装的换算关键是model_type传对qwen25vl/doubao换算完坐标会落回真实屏幕位置⚠️资源别省。7B 就建议 48G 显存级 GPU72B 更吃显存官方明确 GGUF 量化版性能不保证别拿它上正式环境。⚠️模板要选对。三套提示词动作空间各不相同桌面 COMPUTER_USE、手机 MOBILE_USE、只做定位的 GROUNDING选错平台动作就对不上号。⚠️参数别乱调。示例里temperature0、max_tokens128~400截图也要清晰不模糊——grounding 精度很吃截图质量。最后一句建议先别急着上复杂任务用pip install ui-tars配合 部署文档 把单个click动作的坐标闭环跑通在一张固定截图上验证红点是否落在目标元素上——这一步通了后面才谈得上做多步任务。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考