
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning作者Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen核心发表机构Zhejiang University、Alibaba Group论文链接arXiv:2609.20784v1发布于arXiv 预印本cs.CL|——| RetireOPD (Ours) | 60 | 92.2 || w/o Alignment Stagnation | 50 | 89.0 || w/o Relative Competence | 100 | 89.0 || w/o Retirement | – | 82.8 || w/o OPD (GRPO-only) | 0 | 75.0 |结论清晰全程保留 OPD 只有 82.8%而完整方法达 92.2%说明及时移除教师监督对后续优化至关重要单独使用 alignment progress第 50 步退休或单独使用 relative competence第 100 步退休都只达到 89.0%两者结合达到最佳说明“差异停滞”与“能力达标”两个判据互补——前者缺位会导致较早切换后者缺位会导致过晚切换而两种偏差都带来约 3 个百分点的损失。此外从退休点继续训练的对照实验进一步佐证了机制比较“继续联合优化”“切换回 OPD”“移除 OPD 仅用 GRPO”三种策略后只有第三种能让成功率从退休点的 76.6% 稳步提升至 93.8%继续联合优化会进入平台并伴随师生差异持续扩大而切回更强教师对齐则会压缩甚至损害任务性能。自适应退休 vs 线性退火。与 ATOD 的对照显示线性退火在训练早期提升迅速但后期趋于平台自适应准则则持续改进。这一结果支持论文的核心论点教师效用并不按预定义时间表衰减用训练动态确定过渡阶段既能保留早期指导又能避免后期约束。退休阈值敏感性。论文在 3B 设置下扫描了能力阈值γ \gammaγ与有符号相对停滞阈值δ \deltaδ。完整方法γ 0.9 , δ 0 \gamma0.9,\delta0γ0.9,δ0在第 60 步退休、成功率 92.2γ 0.8 \gamma0.8γ0.8在第 55 步退休、90.6γ 1.0 \gamma1.0γ1.0在第 95 步退休、91.4δ 0.03 \delta0.03δ0.03在第 65 步退休、89.1δ 0.05 \delta0.05δ0.05在第 95 步退休、91.4。更宽范围的扫描表明对于γ ∈ [ 0.80 , 0.96 ] \gamma\in[0.80,0.96]γ∈[0.80,0.96]与δ ∈ [ − 0.10 , 0.04 ] \delta\in[-0.10,0.04]δ∈[−0.10,0.04]退休步数保持在默认设置± 5 \pm 5±5步以内只有在相对极端的阈值下才会出现明显延迟。综合来看阈值变化把过渡点从第 55 步推到第 95 步而成功率始终落在 89.1%–92.2% 区间且性能并不随过渡步数单调变化——这说明方法不依赖精细调参或某一个精确的切换点。需要说明“Adaptive Retirement vs. Linear Annealing”一节的正文结论在所提供的源码片段中未完整给出此处仅基于图中可确证的“线性退火后期平台、自适应持续改进”这一趋势进行描述。)五、相关工作 / Related WorkRLVR 与稀疏监督。以 GRPO 为代表的 RLVR 范式依托可验证结果奖励训练智能体但每条轨迹只有一个标量奖励信用分配粗粒度。RetireOPD 保留了 RLVR 的奖励信号作为主驱动只是在其之上叠加一层可控的密集监督并在适当时机撤回这层监督。On-Policy Distillation 与 OPSD。OPD 让学生在自身采样分布上接受更强教师的 token 级反馈OPSD 在没有更强外部教师时把同一模型条件于特权信息后作为教师蒸馏到无条件分支。智能体任务中的特权信息通常是检索或事后hindsight技能。已有方法让教师与学生共享同一策略、仅在上下文上分叉并通过 gating、同步或 advantage shaping 在 token 粒度上控制教师信号。RetireOPD 的关键差异在于蒸馏之前用环境奖励单独训练教师使教师与学生解耦避免“技能分支从未被训练去使用技能”的失效模式。蒸馏与 RL 的混合方法。已有混合方案包括退火蒸馏权重、在预定步数从蒸馏切换到 RL、扩展暴露给学生的轨迹视野、在衰减预算下撤回 in-context 技能、以及顺序执行蒸馏与 RL 等。它们的共同点是 transition 在训练前就被固定。更细粒度的在线决策只存在于局部层面例如仅对整条 rollout 失败的 prompt 施加蒸馏或按 token 门控教师信号但没有任何方法真正移除教师。RetireOPD 的差异是从师生差异与学生相对能力出发在线决定全局 transition并最终彻底移除教师此后仅用 GRPO 训练。与教师退火调度的区别。ATOD 一类方法用预定义线性退火表控制蒸馏权重其隐含假设是教师效用随时间线性衰减。RetireOPD 的代之以数据驱动的判据实验显示这一区别在后期性能上有可观差距。六、局限性与展望 / Limitations Future Work需要明确说明的是所提供的源码片段中并未出现独立的 Limitations 章节也未给出作者对局限性的正式声明因此以下内容是基于片段可确证信息的整理以及片段未覆盖项的标注不构成对作者观点的推测。其一理论分析的适用条件较窄。附录的一阶分析忽略有限样本噪声、假设 GRPO clipping 在局部不激活并且“退出优于联合”的结论需要步长η \etaη足够小。这意味着该分析刻画的是局部行为不能保证在训练早期的强随机性与大更新下仍然成立——这也正是方法需要额外引入能力门槛γ \gammaγ来防止过早退出的原因。其二方法的成本结构未被充分讨论。RetireOPD 需要一个完整的 Phase 1 教师训练阶段教师与学生同规模且教师监督期间每次更新都需要一次额外的教师前向传播片段未给出教师训练步数、总体计算开销相对基线的倍数也未讨论技能检索质量SkillBank 与 Keyword Matching对结果的敏感性。这些属于片段未覆盖项。其三超参与实现细节存在未明确之处。方法定义中出现了监控窗口W WW实验实现只说明每H 5 H5H5个 evaluation steps 评估一次退休准则片段未清晰给出W WW的实际取值与两者的关系δ \deltaδ的具体取值在不同片段中也有“未给出”与“默认δ 0 \delta0δ0”的不同表述需要以论文正文为准。其四对照实验存在信息缺口。“Adaptive Retirement vs. Linear Annealing”一节的正文与结论在片段中缺失无法提取该对比的完整数值结论训练动力学四类曲线成功率、差异、熵、奖励的具体数值同样未在片段中给出。其五可扩展性与泛化性有待检验。所有实验均在 Qwen2.5 系列 1.5B–7B 与 ALFWorld、WebShop 两个文本环境上完成未涉及更大规模模型、多模态环境或需要更长交互视野的任务“外部大教师 OPD 效果极差”这一现象虽被报告但其成因分布不匹配、能力差距过大抑或教师本身未适配任务格式在片段中未做进一步分析是有价值的后续研究方向。七、总结 / ConclusionRetireOPD 处理的是自蒸馏式智能体强化学习中两个被长期默认、却并不成立的假设。它先说清“哪个教师”的问题特权信息本身不会自动产生可靠教师只有用环境奖励显式训练 skill-conditioned 教师才能把上下文中的信息优势转化为一致的行为优势这一点在未优化分支 7B 模型仅 23.4% 成功率的反例中体现得尤为鲜明。它再说清“学多久”的问题教师监督是阶段相关的临时脚手架早期能消除 GRPO 的慢启动并突破纯 OPD 的低上限后期却会与奖励驱动优化冲突把学生封顶在教师水平附近。对应的解法是解耦的教师构建加自适应退休。学生先在 GRPO 与 OPD 的联合目标下吸收技能同时以窗口级统计量监控师生差异的相对变化ρ m ( K ) \rho_m^{(K)}ρm(K)与相对能力η m \eta_mηm一旦差异停止缩小且学生成功率接近教师成功率的 90%就永久移除教师此后仅用 GRPO 继续训练。论文的局部一阶分析为这一判据提供了形式化依据差异停滞意味着⟨ g , h ⟩ 0 \langle g,h\rangle0⟨g,h⟩0的局部冲突或 OPD 信号枯竭而在冲突成立时退出教师能获得更大的一阶回报提升。实验上RetireOPD 在 Qwen2.5-1.5B/3B/7B 与 ALFWorld、WebShop 上一致超过纯 RL、蒸馏、混合基线乃至其自身的 skill-conditioned teacherALFWorld 成功率相对 RL 基线提升 14.1%–18.8%WebShop 准确率提升 11.8%–19.0%消融则显示两个退休判据互补、阈值在较宽范围内稳定、且自适应退休优于预定义线性退火。一句话概括其洞察教师的价值不在于被赋予了多少特权信息而在于是否能被训练去使用它以及是否知道何时该退场。原文摘要:Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher’s success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.PDF链接:https://arxiv.org/pdf/2609.20784v1部分平台可能图片显示异常请以我的博客内容为准