阿里:移动端智能体评测基准MobilePA-Bench

发布时间:2026/9/4 5:33:40
阿里:移动端智能体评测基准MobilePA-Bench 标题MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks来源arXiv, 2608.23035v2️文章简介研究问题现有移动端智能体评测基准要么仅关注图形界面操作而忽视后台工具调用与长期规划要么依赖离线静态匹配而脱离真实运行环境约束如何全面评估移动规划智能体在复杂真实任务中的工具调用与规划能力主要贡献论文提出了MobilePA-Bench这是一个交互式、有状态且以工具为中心的基准测试套件用于评估移动规划智能体的工具调用和规划能力。重点思路构建交互式有状态沙盒开发了一个可执行的模拟环境维护实时应用数据库并返回结构化反馈涵盖13个功能域和212个真实移动工具解耦了中心规划与底层视觉解析开销。定义四维核心能力评估将评估维度划分为基础工具使用处理多模态输入及系统约束、子智能体协作任务分解与委托、记忆使用检索用户偏好以解决隐式请求和技能使用调用预封装复合技能。设计证据对齐的验证机制根据任务完成语义将查询分为三类桶工具调用桶严格匹配序列、状态变更桶检查数据库最终状态差异和智能体行为桶评估交互合理性确保评估的准确性与公平性。引入动态环境摩擦在初始状态中注入参数缺失、权限限制和运行时错误等障碍强制智能体观察动态反馈并进行实时计划修复以测试其鲁棒性。分析总结前沿模型表现仍不可靠即使是表现最好的模型整体加权得分仅为75.52%表明当前大语言模型在严格的工具顺序、权限限制和意外运行时错误下性能急剧下降尚不足以支持完全自主部署。记忆与协作是主要瓶颈模型在基础工具使用上表现较好但在子智能体协作和记忆使用方面存在显著短板特别是检索和应用个性化上下文的能力远低于直接执行工具的能力。缺乏全能型规划器不同模型在不同维度上各有优劣没有单一模型在所有能力上均占主导显示出高级编排能力与可靠端到端执行之间存在巨大差距。复合技能有助于减少错误使用预封装的技能可以减轻长 horizon 规划中的错误累积但前提是智能体能正确选择技能并执行下游动作混合路由行为仍有改进空间。个人观点论文突破了传统GUI-centric或静态函数调用的局限通过构建高保真的有状态沙盒将记忆、技能和多智能体协作原生嵌入到真实的移动工作流中。