如何用人话指挥电脑操作界面:MidScene 零代码 GUI 自动化完整指南

发布时间:2026/9/12 15:18:19
如何用人话指挥电脑操作界面:MidScene 零代码 GUI 自动化完整指南 如何用人话指挥电脑操作界面MidScene 零代码 GUI 自动化完整指南【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene每次大版本上线都要人在网页、安卓、iPhone 上各回归点一遍光是点击和填表就要花掉一下午。MidScene 是一个面向 E2E 测试的 GUI Agent把看屏幕—理解界面—执行操作—校验结果这套人做事的流程交给多模态模型去做。你用一句把价格低于 100 美元的商品加进购物车它就会自己截图、规划、点击再把每一步的截图和断言结果打包成一份可回溯的 HTML 报告同一套 API 覆盖 Web、Android、iOS、鸿蒙和桌面端。 MidScene 与传统自动化工具的三条分界线MidScene 把 GUI Agent 和一套测试工具箱打包在一起通过同一套 Agent API 覆盖五种终端。它和传统自动化工具的区别主要体现在三个维度不写选择器。传统工具要你维护#login-btn这类 XPath 或 CSS 选择器页面一改版脚本就崩MidScene 只看截图靠元素的外观和位置定位纯图标按钮、canvas、跨域 iframe 都能点。指令就是测试。写测试用例不再要拼page.click()和expect()改成一句自然语言MidScene 自己拆解步骤、执行、再截图校验结果是否符合预期。失败可回溯。执行完自动生成 HTML 报告把每一步的截图、AI 决策、元素位置和断言结果都摆出来排查回归失败不用翻日志。MidScene Playground 主界面在浏览器里用自然语言驱动自动化任务 零代码驱动浏览器aiAct、aiQuery、aiAssert 怎么用用一句话指挥浏览器aiAct接收一句自然语言目标它会自己观察当前页面、规划子步骤、逐个执行直到完成目标。具体能做什么写一句搜索耳机把第一件加入购物车MidScene 会自己找到搜索框、输入关键词、识别结果列表、点进商品页再把商品加进购物车。也可以调用aiQuery让模型返回结构化的商品数据如{name, price}[]或调用aiAssert断言购物车里有一件商品。为什么重要多数 UI 自动化的成本不在执行而在维护。选择器一变就要改脚本MidScene 把找到按钮这件事外包给了视觉模型脚本本身只剩一句意图。一套 API 覆盖 Web 到桌面同一套aiAct、aiTap、aiInput覆盖 Web、Android、iOS、鸿蒙和桌面端你不需要为每个平台重写用例。Web 走 Playwright 或 Puppeteer 连接浏览器移动端走 ADB、WebDriverAgent、HDC桌面端走本机的键鼠与截图能力。安卓 Playground用自然语言驱动 Android 设备执行跨应用任务iOS Playground通过 WebDriverAgent 控制 iPhone 完成下单、点赞等操作让 AI 验收用户看到的效果aiAssert用自然语言描述界面应该长什么样MidScene 就会像人肉验收一样去看屏幕颜色对不对、高亮在不在、错误提示有没有出现。canvas 上画的内容、原生 App 的界面同样适用。这一点对像素级回归特别有用传统断言能查 DOM但查不到颜色和高亮MidScene 只看渲染结果恰好补上了这块。执行报告 GIF每一步操作、AI 决策与断言结果都可直接回放 5 分钟跑通 MidScene 第一个 UI 自动化任务环境要求Node.js 18。模型侧需要配置一个具备 UI 定位能力的多模态模型如Qwen3.x、GLM-4.6V、gemini-3.5-flash、UI-TARS云端 API 或自托管都行。获取代码仓库只读仅 clone 使用git clone https://gitcode.com/GitHub_Trending/mid/midscene cd midscene启动最省事的方式是用 Chrome 扩展版 Playground无需搭项目就能在浏览器里试aiAct、aiQuery、aiAssert移动端和桌面端也各有本地 Playground。扩展装好后把模型配置粘进设置即可。最小可验证任务打开任意一个电商首页在扩展侧边栏输入一句把价格低于 100 美元的第一件商品加入购物车。MidScene 会先截图理解布局再自动点击、输入最后把整个过程的截图和断言结果打包进报告。跑通这一句说明模型、扩展、页面三者已经打通。Chrome 扩展版 Playground直接在浏览页面右侧用自然语言驱动自动化 测试、运营、开发三类角色的真实落地场景测试工程师做像素级回归回归测试时测试同学把下单流程用自然语言写进 YAMLMidScene 自动串起登录—搜索—加购—结算每一步的截图和断言都会记录在 HTML 报告里。断言失败时报告里能直接看到 AI 当时看到的截图和给出的理由不用翻日志。运营同学做定时抓取运营在定时任务里挂一条aiQuery从竞品页面提取{商品名, 价格, 库存}MidScene 返回结构化 JSON拿到数据就能进 Excel 或推给下游。不需要写爬虫也不怕改版——选择器变了也不影响。个人开发者让 AI 编码助手自检用 MidScene Skills 给 Claude Code、Cline 这类 AI 编码助手装上手和眼。开发者下完一句写个 Todo App写完后自己打开应用验证增删改助手会自己启动 Electron、截图看界面、点按钮验证结果全程不需要人介入。桥接模式让本地脚本驱动用户已登录的 Chrome跨机器跑 Web 自动化⚙️ MidScene 视觉驱动架构看—动—验 三步循环MidScene 的核心机制可以类比为给 AI 装上一双眼睛它不读 DOM而是像人一样看截图——先截图理解界面再根据视觉定位点击最后用一次新的截图去校验结果。这个循环让它天然跨平台也天然对 canvas 和原生应用友好。在成本上只发截图不发 DOM 树的做法让模型调用费用更可控官方在 AppControlBench 上跑 60 个任务模型总成本仅 0.59 美元。架构上packages/core承载视觉理解与规划引擎packages/web-integration、android、ios、computer等包各自适配平台扩展新终端只需实现截图 操作两个能力。 MIT 许可与 Skills 扩展生态MidScene 采用 MIT 许可仓库开放提交。扩展方式主要有三种MidScene Skills把 UI 自动化能力交给 AI 编码助手调用自定义界面接入只需提供截图与操作两个能力即可挂上第三方终端社区还沉淀了 Python、Java SDK 与 Docker 镜像等第三方扩展。文档站点、Discord 与飞书群是主要交流入口。❓ 模型费用、离线能力与测试框架接入 FAQ需要编程基础吗不需要。Chrome 扩展版 Playground 完全零代码直接输入自然语言就能跑只有把用例集成到 CI 时才需要写一点 YAML 或 TypeScript。数据会上传到云端吗MidScene 本身不发数据屏幕截图是发给模型去做视觉理解的。想完全本地化可搭配 Ollama 等自托管开源模型截图不出内网断网时也能离线跑完。模型费用高吗单次截图理解成本远低于把整个 DOM 塞给模型的方案。官方 AppControlBench 数据显示 60 个任务总成本约 0.59 美元配合缓存后同类任务再跑会更便宜。怎么接入已有的测试框架aiAct、aiTap、aiAssert都是普通 JS 方法直接嵌进 Playwright、Puppeteer 或 JUnit 里就能用不替换框架只是多一个用自然语言驱动 UI的能力。结语先跑通浏览器里那句加购指令再考虑接入 CI、跑移动端或让编码助手自检——这三步走完你就拿到一个能用自然语言维护的跨平台自动化底座。官方文档apps/site/docs/zh/核心源码packages/core/示例配置packages/cli/tests/快速上手指南apps/site/docs/zh/quick-start.mdx【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考