UI-TARS desktop:一句话让 AI 替你操作电脑,完整 GUI 自动化指南

发布时间:2026/8/22 20:36:09
UI-TARS desktop:一句话让 AI 替你操作电脑,完整 GUI 自动化指南 UI-TARS desktop一句话让 AI 替你操作电脑完整 GUI 自动化指南【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop把打开设置、关掉自动保存、再填个值这类要手动点 12 步的重复操作交给一句指令去完成——这就是 UI-TARS desktop 要做的事。它是一个基于视觉语言模型VLM即能看懂屏幕图片并输出操作的模型的开源桌面应用输入一句中文或英文它会自动看屏幕、找控件、代你点击和输入适合想自动化重复操作的办公用户也适合想上手 GUI Agent 的开发者。它能替你做什么自然语言即指令不用写脚本帮我打开 VS Code 的自动保存就是完整任务描述。计算机操作器Local Computer Operator每一步先截图模型识别目标控件位置后完成点击、输入、快捷键等真实鼠标键盘操作。浏览器操作器Local Browser Operator在你已安装的 Chrome、Edge 或 Firefox 中执行导航网页、搜索、填表单等任务。实时反馈应用右侧面板逐张展示执行过程的截图它看到什么、点了什么都看得见。执行报告任务结束后一键导出 HTML 报告记录每一步的截图与动作方便复盘和分享。首页的两个按钮对应两类操作器Operator即把模型决策翻译成真实鼠标键盘动作的执行层Use Local Computer 控制本地电脑Use Local Browser 控制本地浏览器。快速上手10 分钟跑通 UI-TARS desktop第一步安装应用。macOS 用户有 Homebrew 的话一条命令即可brew install --cask ui-tarsWindows 用户可从发布页下载对应安装包。想从源码跑起来的话git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm dev:ui-tars第二步授予系统权限macOS 必做。首次启动时系统会询问两项权限辅助功能用于模拟鼠标键盘和屏幕录制给模型截屏看。两者都要在系统设置 → 隐私与安全性中打开否则任务会在第一步就卡住。第三步接入模型。应用本体不含模型需要指向一个 UI-TARS 视觉语言模型服务最省事的两条路Hugging Face在模型页面点击 Deploy from Hugging Face选择 UI-TARS-1.5-7B部署完成后会拿到 Base URL、API Key 和 Model Name。火山引擎方舟直接接入托管的 Doubao-1.5-UI-TARS 推理 API。在应用设置里把这三个值填进 VLM 配置项注意 VLM Provider 要选与模型匹配的选项否则动作解析会出错。填完即可发起第一轮 GUI 操作任务。典型任务实战两个任务走一遍任务一修改本地应用设置计算机操作器指令示例帮我在 VS Code 中打开自动保存并把自动保存的延迟设为 500 毫秒。执行节奏是输入指令首页选 Use Local Computer在输入框写好这句话点击发送。观察执行右侧 ScreenShot 区域每步出现一张截图模型先定位菜单、再找到 Auto Save 设置项、最后输入 500过程中可随时暂停或终止。确认结果完成后去 VS Code 设置里核对 Auto Save 的延迟值并把本次过程导出为 HTML 报告存档。任务二跨页面比价浏览器操作器同样的节奏入口换成 Use Local Browser指令类似帮我比较两个购物网站上的 iPhone 价格模型会自行打开浏览器、输入搜索词、在页面间切换汇总。前提是机器上装好了 Chrome、Edge 或 Firefox 之一。任务是否成功可以逐张对照截图确认发现走偏就终止任务换一句更具体的指令重新发起。常用配置3 个参数最值得弄懂设置页选项不少日常用只需掌握这几个VLM Base URL / API KEY / Model Name模型接入三件套。Base URL 必须来自你的模型服务且以/v1结尾填完先点 Check Model Availability 验证连通再开始任务。Max Loop25–200默认 100一轮对话允许模型执行的最大步数。任务链路长就调大只想快速办完一件小事就调小能省时间省调用。Loop Wait Time0–3000ms默认 1000每次操作后、截屏前的等待时长。如果页面有加载动画截屏太早模型看到的是中间状态调大这个值执行会更稳。Languageen/zh只影响模型的输出语言不影响应用界面语言。想和同事共享同一套配置可以写成 Preset预设一组打包好的配置项通过本地文件 URL 一键导入name: UI TARS Desktop Example Preset language: en vlmProvider: Hugging Face for UI-TARS-1.5 vlmBaseUrl: https://your-endpoint.huggingface.cloud/v1 vlmApiKey: your_api_key vlmModelName: your_model_name项目根目录的examples/presets/default.yaml就是官方示例照抄改值即可。边界与避坑它做不到什么、怎么自查文档对当前限制说得比较坦诚用之前先有心理预期仅支持单显示器多屏环境下部分任务会失败多台显示器就先切回单屏。权限是前提macOS 没开屏幕录制权限模型截不到图任务第一步就会停。看到截图区空白或 No images to display先查权限。模型要自己接项目提供的是执行外壳模型服务需要自行部署或申请 API模型接口慢或不稳时任务节奏会直接变差。长任务会到顶步数达到 Max Loop 上限任务自动结束看报告确认进行到哪一步把剩下的拆成新指令继续。远程免费试用已下线早期内置的免费 Remote Operator 试用服务已于 2025 年 8 月 20 日停止需要远程操作要自行部署。卡住时的自查顺序系统权限 → 模型连通性Check Model Availability→ 浏览器是否安装 → 任务是否复杂到需要拆分。延伸方向继续深入的三条路1. 用 SDK 写自己的 GUI Agent。ui-tars/sdk是构建 GUI 自动化 Agent 的跨平台工具包桌面应用本身也基于它构建。十几行代码就能在 Node.js 里跑起截图 → 模型决策 → 执行动作的循环import { GUIAgent } from ui-tars/sdk; import { NutJSOperator } from ui-tars/operator-nut-js; const agent new GUIAgent({ model: { baseURL, apiKey, model }, operator: new NutJSOperator(), }); await agent.run(Open Chrome);想接入应用没覆盖的设备继承 Operator 类、实现screenshot()怎么截图和execute()怎么执行模型给出的动作两个方法即可。2. 用 CLI 在终端控制电脑。运行npx ui-tars/cli start填入模型三件套后直接在终端下达指令适合习惯命令行的人。3. 读源码理解实现。桌面应用源码在 apps/ui-tars/src/SDK 的模型调用与动作执行逻辑在 packages/ui-tars/sdk/项目根目录docs/下有快速开始、设置等文档examples/gui-agent-2.0/还有可直接运行的示例自己动手时可以先照着改。现在就能动手的下一步macOS 上跑brew install --cask ui-tars打开辅助功能和屏幕录制两项权限在 Hugging Face 部署一个 UI-TARS-1.5-7B 并填好设置里三个模型参数然后对它说出第一句帮我打开 VS Code 并开启自动保存。跑通第一个任务后再决定是往 SDK 方向深入还是把它固化成自己的日常自动化工具。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考