UI-TARS-desktop:4 步上手,用一句自然语言替你操作电脑与浏览器

发布时间:2026/9/2 14:22:58
UI-TARS-desktop:4 步上手,用一句自然语言替你操作电脑与浏览器 UI-TARS-desktop4 步上手用一句自然语言替你操作电脑与浏览器【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop每天早上打开浏览器、登录后台、导出报表同样的鼠标点击重复几十次。UI-TARS-desktop 让你用一句自然语言完成这些事它是一个开源的 GUI Agent 桌面应用靠视觉大模型看懂屏幕自动完成点击、输入、滚动等图形界面操作替你操控本地电脑和浏览器。项目定位它替你解决的是重复点击这件事一句话把用鼠标和键盘完成的 GUI 操作交给 AI你只负责用自然语言下指令。它和传统自动化工具写脚本、找控件、维护坐标的核心差异视觉驱动不依赖 DOM—— 通过实时截屏识别界面元素所以不仅能在网页里操作也能操作 VS Code、Finder 这类原生桌面应用零脚本的自然语言交互—— 不用写任何代码直接说把自动保存延迟设为 500 毫秒模型自行拆解步骤双操作器模式—— 本地计算机操作器直接控制你的电脑本地浏览器操作器控制已安装的 Chrome/Edge/Firefox跨平台—— 提供 Windows 与 macOS 版本本地执行—— 截屏与操作都在你自己的机器上完成屏幕内容不出本机快速上手路径4 步跑通第一个 GUI 自动化任务整条主线是装应用 → 给权限 → 接模型 → 下指令。第 1 步安装应用。macOS 有 Homebrew 时一条命令即可没有则从发布页下载后拖入 ApplicationsWindows 直接运行安装程序。brew install --cask ui-tars第 2 步授予系统权限macOS 必须。进入 系统设置 → 隐私与安全性分别打开辅助功能和屏幕录制两项 UI TARS 权限——前者让它可以控制鼠标键盘后者让它能截屏读屏。第 3 步接入视觉语言模型。打开设置界面在右上角点击Deploy from Hugging Face部署UI-TARS-1.5-7B端点拿到 Base URL、API Key 和模型名称填入设置中文用户也可以改用火山引擎的 Doubao-1.5-UI-TARS下一节会给现成配置。填完点一下Check Model Availability能连通就可以开工了。第 4 步发起任务。点击开始新任务选择本地计算机或浏览器模式输入指令AI 开始逐步操作。关键配置最省事的 4 个必填项真正需要理解的只有 4 个配置项其余全部保持默认即可。配置项默认值推荐值说明VLM Provider无默认必填与模型来源一致如Hugging Face for UI-TARS-1.5选错会导致动作解析错位这是最常见的配置失误VLM Base URL必填Hugging Face 端点地址HF 端点必须以/v1/结尾Languageen中文用户改zh只影响模型输出语言不影响应用界面语言Max Loop100常规任务可降到50单轮任务的最大步数范围 25-200如果你走火山引擎路线直接把下面这份配置贴进设置即可来自官方文档的现成示例Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328完整参数说明见 docs/setting.md。典型使用场景3 条照着就能成功的自然语言指令选对模式本地计算机 or 浏览器然后把指令原样输入就是可复现的最小任务。场景一修改桌面应用设置本地计算机模式请帮我在 VS Code 设置中打开自动保存功能并将自动保存操作延迟设置为 500 毫秒预期效果应用自动打开 VS Code、进入设置、找到自动保存选项、打开开关并修改延迟值。这是官方展示的经典用例。场景二网页信息抓取浏览器模式帮我查看一下 GitHub 上 UI-TARS-desktop 项目的最新 open issue预期效果自动唤起已安装的 Chrome/Edge/Firefox导航到 issues 页面读取并汇报最新问题。场景三组合操作浏览器模式打开浏览器在天气网站查询今天北京的天气并把最高温度告诉我预期效果打开浏览器 → 进入天气站 → 定位北京 → 读屏提取最高温全程你只需看结果。执行过程中你可以在应用里实时查看每一步的截图与动作随时叫停。进阶玩法SDK、操作器与预设管理桌面应用之外仓库里还有三块值得看一眼的生态。① SDK把 GUI Agent 装进你自己的程序。ui-tars/sdk支持 Node.js 和浏览器环境一行命令就能在命令行里体验npx ui-tars/cli start填入模型配置后即可控制电脑。SDK 源码在 packages/ui-tars/sdk/文档见 docs/sdk.md。② 多操作器同一个模型驱动不同设备。packages/ui-tars/operators/ 内置 NutJS 桌面操作器鼠标/键盘/滚动/截屏、ADB 操作器Android 设备、浏览器操作器与 browserbase 云端操作器你也可以基于 Operator 接口扩展自己的设备。③ 预设管理一套配置多机同步。支持从 YAML 文件或 URL 导入预设URL 预设每次启动应用时自动拉取更新适合团队共享同一套模型配置。示例文件见 examples/presets/default.yaml机制说明见 docs/preset.md。另外每轮任务结束后可以把执行过程导出为 HTML得到带截图的完整操作报告方便复盘或分享。常见问题权限、模型连接与多显示器Q1macOS 为什么必须给辅助功能和屏幕录制两个权限屏幕录制负责截屏读屏辅助功能负责控制鼠标键盘缺任何一个任务都无法执行。授权后建议重启应用。Q2点击Check Model Availability连接失败怎么排查按顺序查三处Hugging Face 的 Base URL 是否以/v1/结尾VLM Provider 是否与模型来源一致HF 模型必须选Hugging Face for UI-TARS-1.5API Key 是否从对应端点页面复制。Q3浏览器模式用不了浏览器操作器控制的是你本机安装的浏览器需要先装好 Chrome、Edge 或 Firefox 的任一稳定版。Q4支持多显示器吗目前仅支持单显示器环境多显示器配置可能导致部分任务执行失败见 docs/quick-start.md 的前置说明。Q5复杂任务跑不完或步骤失控怎么办把 Max Loop 调小限制步数并把大任务拆成打开某应用完成某设置这样的子任务分次执行成功率更稳定。资源导航与下一步快速开始docs/quick-start.md设置详解docs/setting.md预设管理docs/preset.mdSDK 文档docs/sdk.md示例预设examples/presets/default.yaml操作器源码packages/ui-tars/operators/桌面应用源码apps/ui-tars/src/从源码构建可执行git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop后按仓库说明安装依赖下一步很简单装好应用、配好模型后先跑一个最小任务——打开浏览器并搜索今天的新闻。它能成功你就已经具备了用自然语言自动化一切重复操作的能力。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考