腾讯:UI-Mate提升GUI智能体可靠性

发布时间:2026/8/27 10:27:47
腾讯:UI-Mate提升GUI智能体可靠性 标题UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations来源arXiv, 2608.15930v1️文章简介研究问题如何解决基础GUI智能体在部署中面临的训练数据稀缺与分布偏差以及交互层面因指令模糊导致的执行不可靠问题主要贡献论文提出了UI-Mate一个结合环境 grounded 训练栈和上下文演示学习的开源基础GUI智能体并发布了OSWorkerBench基准测试。重点思路构建可扩展的环境 grounded 训练栈开发闭环数据引擎自动化任务生成、环境构建、 rollout 执行、过滤及分层能力平衡。通过统一的任务-验证器包在大规模并行环境中进行监督微调SFT和在线强化学习RL解决数据覆盖不均问题。引入上下文演示学习机制DemoCUA将多模态演示转化为灵活的子任务级工作流而非僵化的轨迹回放。智能体在执行时参考演示步骤但依据实时界面截图自主决策能在关键处遵循演示在差异处重新规划适应非标准操作。发布OSWorkerBench基准测试包含41个应用程序中的100个长程办公任务支持仅指令和演示引导两种评估模式。提供自演示相同任务和变体演示相关不同任务资源专门评估长程工作流的可靠性和程序迁移能力。分析总结UI-Mate-27B在通用计算机使用基准上表现优异在OSWorld-Verified得分为77.0%在WindowsAgentArena得分为66.2%确立了开源模型的新SOTA性能接近顶级闭源模型。演示引导显著提升长程任务可靠性在OSWorkerBench的33个自演示任务中单次演示使严格成功率从17.2%提升至35.4%进度得分从67.9%提升至81.1%。在OSWorld子集上演示使平均得分从40.3%大幅提升至65.8%。训练策略有效弥补基座模型差距相比Qwen3.6-27B基座UI-Mate-27B在OSWorkerBench上的严格成功率和进度分别提升了17.7和24.5个百分点证明环境 grounded 训练对跨应用状态跟踪和错误恢复至关重要。演示能纠正特定执行错误案例显示演示能帮助智能体理解操作对象如修改模板而非实例和视图控制如PDF缩放定位避免仅凭指令产生的视觉误读或上下文错误。个人观点论文打破了传统GUI智能体仅依赖文本指令的局限通过“演示即工作流”的理念将人类或强智能体的操作经验转化为可自适应的指导信号。