9.26 大语言模型研究简报:把 Agent 开发做成“数据—训练—Harness”闭环

发布时间:2026/9/27 8:52:17
9.26 大语言模型研究简报:把 Agent 开发做成“数据—训练—Harness”闭环 Qwen-Planner-Agent把 Agent 开发做成“数据—训练—Harness”闭环公开时间北京时间2026 年 9 月 24 日 22:38机构Alibaba Token Hub / MAI Team状态论文预印本 技术报告核心进展阿里MAI团队发布Qwen-Planner-Agent重点不是单独训练一个更强的手机Agent而是建立一套闭环开发框架AI for Data → AI for Training → AI for Harness其中Data多个 Agent 自动构造任务、采集轨迹、分析失败并据此生成下一轮训练数据Training先做planning-oriented SFT再做hybrid-environment online RLCARE根据模型当前能力动态调整reward / advantage在任务成功率和推理、工具调用成本之间做权衡Harness统一接入Memory、Skills、Tools和sub-agent并把执行失败重新反馈给数据与训练环节。作者报告Qwen-Planner-Agent 27B在自建MobilePA-Bench上达到77.05% Overall相比基座模型提升9.83 个百分点。该结果来自团队自建benchmark仍需独立复现。为什么重要真正值得关注的是Model–Harness co-evolution。过去很多Agent系统是固定模型 人工 Harness Benchmark这里变成执行 → 失败证据 → 数据生成 → RL → Harness 修改 → 再执行也就是说模型训练和 Agent runtime 不再完全分离而是共同迭代。与此前工作的关系这项工作延续了Qwen / MAI在Mobile Agent、GUI Agent上的路线但进一步把重点从“模型本身更强”转向训练数据飞轮 Online RL Memory/Skill/Tool Harness 的联合优化。它更像一种agentic post-training runtime co-design方法而不是新的通用基础模型。具体技术路线这个是Qwen论文中给出的lifecycle图这个图里Qwen提出的核心其实不是一个单一训练流程而是一个持续自我改进的AI-for-AI Lifecycle。它把Agent的开发拆成三个相互连接的闭环AI for Data、AI for Training、AI for Harness再用 AI 诊断和人工审核把三个闭环串起来。可以概括成真实任务执行 → 收集轨迹 → 构造/清洗数据 → 训练 Planner → 在线 RL → 真机执行 → 诊断失败 → 回流数据与训练 → 再迭代第一部分是 AI for Data。系统先自动构造可执行任务然后让 Agent 与环境交互收集成功和失败的 trajectory。收集到的数据不会直接拿去训练而是经过 Clean、Filter、Reweight把高价值轨迹筛出来。这里形成第一个循环Task Construction → Trajectory Collection → Data Composition → 再生成新任务意思是数据集不是一次性固定的而是随着模型暴露出的弱点持续更新。第二部分是 AI for Training。整理好的数据先进入 Planning Cold Start让模型通过监督学习掌握基本 planning pattern。之后进入 Online Agentic RL在真实或近真实环境中继续强化。这里的关键是 CARE schedule根据模型当前能力动态调节训练难度和 reward使训练重点跟着模型的短板变化。训练后再做 Planner Evaluation测模型在哪些任务上成功、在哪些地方失败这些诊断结果又反馈给下一轮 cold start 和 RL。于是形成第二个闭环Planning Cold Start → Online Agentic RL → Planner Evaluation → 再训练第三部分是 AI for Harness。训练好的模型并不是裸奔而是放进一个 Harness 里运行。Harness 包括Context Skills Memory模型负责 Plan → Act → RecoverHarness 则提供上下文、技能调用、记忆和运行时支持。系统随后在真实设备上执行任务执行结果再反馈回来。所以这一部分的闭环是Model → Harness → Real-device Execution → Feedback → Model / Harness这点很重要因为 Qwen 的思路不是只优化模型参数而是同时优化模型和 runtime。整个框架最关键的是底部这条“跨层反馈链”Real-device traces → AI-assisted Diagnosis → Human Review → 版本控制 / 审批 → 回流 Data / Training / HarnessAI 先分析失败轨迹提出修改建议人类负责最终审核、版本控制和批准。也就是说它不是完全自动闭环而是 AI 自动诊断 人类治理。如果压缩成一句话Qwen Planner Agent 的 Lifecycle 本质上是一个“数据飞轮 训练飞轮 Harness 飞轮”的三重闭环真实执行产生失败失败被 AI 诊断诊断结果反过来生成新数据、调整训练策略和改进运行时系统从而让 Agent 持续迭代。相比传统流程Dataset → Train → Deploy它更接近Deploy → Observe → Diagnose → Improve Data / Model / Harness → Redeploy这也是这张图最核心的思想。P.S. 这里 lifecycle 一般指的是一个产品“从创建到持续运行和迭代”的全过程针对上述内容中提到的核心模块可以分成AI for Data数据、‘AI for Training’ 训练、AI for Harness执行框架三个部分而且根据技术文档可以把这三个模块理解成一个很清晰的闭环Data负责发现并补齐能力缺口Training负责把数据转化为能力Harness负责把能力稳定地落到真实执行并把执行反馈重新送回前两层。AI for Data把“失败”转成下一轮训练数据核心目标是不是被动收集数据而是根据模型当前不会什么主动生成它最需要的数据。流程可以压缩成能力需求 / 评测失败 → 构造可执行任务 → 多环境采集 trajectory → 验证与筛选 → 调整采样权重 → 进入训练其中有三个关键动作Task Construction根据能力需求或评测暴露的问题自动构造任务明确目标、工具、初始状态和完成条件。Trajectory Collection让 Agent 在 LLM 模拟环境、Sandbox 和真机上执行收集完整的动作、反馈和结果。Weakness Diagnosis根据训练和评测结果判断哪些能力已经掌握、哪些不稳定、哪些完全缺失然后分别做 down-sample / up-weight / new tasks。所以 Data 模块本质上是一个failure-driven data flywheel不是“数据越多越好”而是让每一轮数据都对应一个明确的能力缺口。AI for Training根据模型能力动态调整学习目标核心目标是模型在不同能力阶段不应该使用完全相同的训练目标和奖励。训练分成两步。第一步是 Planning Cold Start / SFT。先用高质量 trajectory 教模型基本的 planning pattern。对于错误动作可以 mask 掉但保留经过验证的 recovery trajectory让模型不仅学会“正确执行”也学会“出错以后怎么恢复”。第二步是 Online Agentic RL。模型进入模拟环境、Sandbox 和精选真机环境中实际执行再根据结果在线更新。这里最关键的是 CARE。它根据当前模型的 competence 动态切换训练重点不会做时 → 强调 exploration / progress基本会做时 → 强调 accuracy / task completion已经稳定会做时 → 强调 efficiency减少冗余 reasoning 和 tool calls也就是先学会做再学会稳定做最后学会高效做。因此 Training 模块不是固定 reward 的 RL而是 competence-aware curriculum。AI for Harness让模型能力在真实环境中稳定发挥Harness 可以理解成 Agent 的 runtime / execution layer。模型主要负责Reasoning → Planning → 输出 structured actionsHarness 负责理解运行时上下文 → 选择技能/工具 → 路由 action → 管理 memory → 执行 → 验证这里有三个关键部分。Scenario Adapter根据当前任务和可用工具加载合适的 skills、instruction 和操作流程。Memory Manager不是简单保存历史而是保留 evidence / provenance检查信息来源、冲突和过期内容。Real-device Execution Verifier实际在设备上执行并记录成功轨迹和失败结果。这些真实执行证据再进入 AI-assisted Diagnosis系统会分析是模型 planning 错了是 memory/context 有问题是 skill 不合适还是 Harness 的 routing / instruction 有问题然后决定下一轮是更新 Model还是更新 Harness或者两者一起更新。所以 Harness 不是固定工程层而是可以与模型 co-evolve 的。总体 Workflow整个系统可以压缩成这一条链真实执行 → 暴露失败 → AI 诊断能力缺口 → 构造针对性任务 → 收集和整理 trajectory → SFT 冷启动 → Online RL → 更新模型 → Harness 真机执行 → 再收集反馈进一步抽象就是Observe → Diagnose → Generate Data → Train → Deploy → Execute → Observe三个模块分别负责AI for Data决定“下一步应该学什么”AI for Training决定“应该怎么学”AI for Harness决定“学到的能力怎么在真实环境中稳定发挥”因此 Qwen Planner Agent 最核心的思想可以概括为把 Agent 开发从一次性的“数据 → 训练 → 部署”变成由真实执行反馈驱动的 Data–Model–Harness 协同演进闭环。最后如果大家感兴趣的话可以仔细阅读相关链接。相关链接arXivQwen-Planner-Agent官方项目页 / Technical Report官方 GitHubHugging Face Papers