【OPD】Rethinking On-Policy Distillation: Phenomenology, Mechanism, and Recipe

发布时间:2026/10/8 6:57:26
【OPD】Rethinking On-Policy Distillation: Phenomenology, Mechanism, and Recipe note动机OPD 已成为后训练常用方法但一个强 teacher 为什么有时能提升 student、有时完全无效过去解释并不清楚。本文系统研究 OPD 的成功条件和 token-level 机制。发现OPD 成功需要两个条件① teacher 与 student 的 thinking pattern 兼容② teacher 必须提供 student 训练分布中真正没见过的能力。仅仅 teacher 分数更高还不够。论文通过 weak-to-strong reverse distillation 发现同家族 1.5B 与 7B teacher 从 student 视角可能几乎“分布不可区分”。机制OPD 的有效学习主要发生在 student 自己访问到的 prefix 上teacher 与 student 逐步对齐一小批 高概率重叠 token这部分 token 虽数量少却承载约 97%–99% 概率质量。因此 OPD 本质不是“把 teacher 全分布搬过去”而是在 student 自身轨迹上做 dense token-level纠偏。Recipe当 OPD 失败时作者提出两招off-policy cold start 先把 student 拉到 teacher 相近思维模式再做 teacher-aligned prompt selection挑 teacher 真正有新增信息的样本继续 OPD。文章目录note一、研究动机OPD 很重要但为什么会 stronger teacher → worse student 二、论文核心OPD 有效的两个必要条件 一个 token 级机制2.1 条件一思维范式一致Thinking-pattern consistency2.2 条件二高分 ≠ 新知识Higher scores ≠ new knowledge2.3 机制梯度信号集中在重叠 token这个小集合上2.4 三种监督粒度论文 §2.2三、实验结果与分析3.1 现象验证反向蒸馏Reverse Distillation3.2 机制验证动态签名3.3 配方Recipe两条修复策略策略一Off-policy Cold Start离策略冷启动策略二Teacher-aligned Prompt Selection教师对齐提示选择3.4 成本Cost密集监督的免费午餐并不免费四、总结与启示五、局限与待澄清点一、研究动机OPD 很重要但为什么会 stronger teacher → worse student Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe清华大学等2026-04-15 代码github.com/thunlp/OPDOn-policy distillationOPD同策略蒸馏指让学生模型自己采样生成轨迹再用教师模型对这批学生真正访问过的状态给出的逐 token 对数概率作为密集监督信号。相比离线蒸馏SFT 在教师固定输出上训练存在 exposure biasOPD 被认为更高效、更贴合强化学习式的后训练。Qwen3、MiMo、GLM-5 的后训练流程都采用了它Thinking Machines Lab 也以远低于 RL 的计算量复现了 Qwen3 的 OPD 配方。但实践中有个刺眼现象一个更强的教师可能完全无法提升学生而一个更弱的教师反而成功——哪怕弱教师与学生的初始对齐度更低。这说明教师分数更高既不是 OPD 有效的充分条件也不是必要条件。论文要回答三个问题现象层面什么条件下 OPD 成功 / 失败§3 Phenomenology机制层面为什么教师 token 级信号能把学生分布推到正确方向§4 Mechanism配方层面失败配置能否被修复密集监督有没有隐藏成本§5–§6 Recipe Cost二、论文核心OPD 有效的两个必要条件 一个 token 级机制左边为什么强 teacher 不一定有效论文发现teacher benchmark 分数更高不代表 student 就一定能学到。关键是 teacher/student 的 thinking pattern 是否兼容以及 teacher 是否真的提供了新的信息增益。中间OPD 真正学的是什么成功 OPD 的特征是student 在自己访问到的 states 上逐渐和 teacher 对齐一小部分 高概率 overlap tokens虽然 token 数不多但承载了约 97%–99% 的概率质量。右边失败了怎么救用 off-policy cold start 先把 student 拉到 teacher 相近的思维模式再做 teacher-aligned prompt selection挑真正有新增知识的样本继续 OPD2.1 条件一思维范式一致Thinking-pattern consistency师生应在高概率 token 集合上高度重叠即想在同一个地方。用Overlap Ratio度量M overlap E t [ ∣ S t ( p ) ∩ S t ( q ) ∣ k ] , S t ( p ) TopK ( p t , k ) , S t ( q ) TopK ( q t , k ) \mathcal M_{\text{overlap}} \mathbb E_t\Big[\frac{|S_t^{(p)} \cap S_t^{(q)}|}{k}\Big],\quad S_t^{(p)}\text{TopK}(p_t,k),\;S_t^{(q)}\text{TopK}(q_t,k)Moverlap​Et​[k∣St(p)​∩St(q)​∣​],St(p)​TopK(pt​,k),St(q)​TopK(qt​,k)低重叠 ⇒ 学生的概率质量集中在与教师不相交的 token 上 ⇒ 策略错峰教师信号指不到学生身上。即使教师 benchmark 更高思维范式不匹配会造成很低的初始重叠训练也补不回来。2.2 条件二高分 ≠ 新知识Higher scores ≠ new knowledge即便范式一致、教师分数更高若师生用同一份数据、同一套配方训练二者会在各自规模下收敛到相似的分布——教师已经没有可迁移的新信号。只有教师携带了学生训练期间未曾见过的知识时OPD 才有实质增益。关键反直觉结论弱到强反向蒸馏验证用 1.5B 学生去蒸馏 7B 同族教师往往无效——二者在分布上对学生而言不可区分。OPD 学的是思维范式而不只是蹭到更高质量。2.3 机制梯度信号集中在重叠 token这个小集合上成功 OPD 的动态签名dynamic signature观测量失败运行成功运行Overlap Ratio停滞不前72% → 91%持续上升熵差H ( p t ) − H ( q t ) H(p_t)-H(q_t)H(pt​)−H(qt​)始终偏大逐渐收窄共享 top-k 的累计概率质量—97%–99%Overlap-Token Advantage重叠集上的p ˉ t ( v ) [ log ⁡ q ˉ t ( v ) − log ⁡ p ˉ t ( v ) ] \bar p_t(v)[\log\bar q_t(v)-\log\bar p_t(v)]pˉ​t​(v)[logqˉ​t​(v)−logpˉ​t​(v)]均值趋近于 0表示学生在教师偏好的 token 上以恰当置信度分配了质量。因果验证只在重叠 token 上计算 KL 监督性能与完整 top-k 监督持平→ 重叠集就是 OPD 梯度的主作用域principal locus。2.4 三种监督粒度论文 §2.2方式计算梯度密度代价Sampled-token OPD只在学生采样到的 token 上算log ⁡ p t − log ⁡ q t \log p_t-\log q_tlogpt​−logqt​最低无偏单样本估计最省工业界最常用Full-vocabulary OPD全词表 KL最高O ( B T M ) O(BTM)O(BTM)显存Top-k OPD仅在S t TopK ( p t , k ) S_t\text{TopK}(p_t,k)St​TopK(pt​,k)上 renormalize 后算 KL中等折中保留高概率区多 token 监督三、实验结果与分析3.1 现象验证反向蒸馏Reverse Distillation设置固定学生如 Qwen3-1.5B换不同教师同配方 OPD。同族 1.5B ↔ 7B分布对学生视角不可区分增益极小 → 验证条件二。跨范式 / 跨家族强教师初始重叠低训练无法修复 → 验证条件一。更弱但范式一致的教师反而成功。训练动态可与 benchmark 分数完全解耦分数在涨overlap 不涨 ⇒ 无效训练。对应论文图表Figure 1失败案例对比、Figure 2反向蒸馏的 performance vs. overlap 散点/曲线。读图要点横轴训练步数纵轴看benchmark 曲线与overlap 曲线是否同步不同教师用不同颜色找分数高但重叠平的那条线。3.2 机制验证动态签名Overlap Ratio 曲线成功组单调上升至 0.9 附近失败组贴地走平。Entropy gap 曲线成功组收敛到 0 附近失败组保持显著正值学生比教师更不确定/更散。Probability mass on shared set97%–99%说明只要对齐高概率 token就等于对齐了几乎所有概率质量。Ablation仅重叠 token 监督 ≈ 全 top-k 监督仅非重叠 token 监督 ≪ 全监督 → 梯度信号确由重叠集承载。对应论文图表Figure 3 / Figure 4overlap、entropy gap、advantage 随训练步数变化以及overlap-only vs full-top-k的柱状对比。读图要点看曲线斜率与终点不看绝对数值看 shaded area方差判断是否稳定。3.3 配方Recipe两条修复策略策略一Off-policy Cold Start离策略冷启动做法OPD 之前加一段 SFT warmup直接在教师生成的 rollout上训练。作用把初始 overlap ratio 抬起来桥接思维范式鸿沟。效果原本失败的配置被救回且恢复后呈现overlap 上升 advantage 改善 熵差收窄的成功签名。策略二Teacher-aligned Prompt Selection教师对齐提示选择做法从教师后训练数据中挑选 prompt 用于 OPD。作用让学生访问的状态更贴近教师擅长的高概率区域sharpens 对齐。副作用学生熵显著下降分布变窄、多样性丧失。解法与out-of-distribution prompt 混合使用在对齐与探索之间取平衡。对应论文图表Table 1 / Table 2各策略的 benchmark 增益 相应动态曲线。读图要点先看是否从失败变成功再看熵是否被压塌——策略二必须配合 OOD 混合才健康。3.4 成本Cost密集监督的免费午餐并不免费奖励质量随轨迹深度衰减教师作为 reward model 的判别力在 rollout 越靠后的 token 上越差。不稳定性从源头向后传播先出现在后期 token再反向传播到整条轨迹。惊人发现即便是失败的教师其奖励信号与 rollout 正确性仍是全局相关的globally correlated。⇒ 失败不是信号质量差而是局部优化几何local optimization geometry的问题更大的教师可能在学生策略附近制造了一个局部平坦的奖励景观使 token 级梯度推不动。根本张力监督密度 ↑ ↔ 监督可靠性 ↓。这指向 OPD 在长程推理与 agentic 场景的缩放瓶颈。对应论文图表Figure 5 / Figure 6reward quality / token-level advantage 随 token 位置或 rollout 长度的变化。读图要点找随深度单调下降的趋势线与拐点论文给出 1K → 0.3716K → 0.02 的量级。四、总结与启示OPD 的本质是在学生走过的路上把高概率 token 的分配往教师的方向掰。因此它要求① 师生想在同一处overlap 高② 教师真有学生没见过的东西新知识。满足则渐进对齐、熵差收窄、重叠集承载 97% 概率质量不满足则重叠停滞、熵差顽固、分数白涨。修复手段是先离策略 SFT 抬重叠再教师对齐 prompt sharpen 对齐须混 OOD 防熵塌。而密集监督的可靠性随轨迹变长而衰减构成 OPD 通往长程 agent 的根本性障碍。给实践者的三条可操作建议别只看教师 benchmark先算初始 Overlap Ratio——低于 ~0.7 就要警惕优先考虑同族/同范式教师或先做 cold start。监控训练动态而非只看任务分数overlap ↑、entropy gap ↓、advantage → 0 三者同步才是真在学。长轨迹场景慎用纯 OPD后半段 token 的教师奖励已接近噪声应转向分段/稀疏 结果级奖励的混合目标。五、局限与待澄清点模型与任务范围结论主要在 Qwen3 / DeepSeek 系、0.5B–7B、数学推理任务上成立跨家族、跨模态、代码、agent 的泛化性待验证。分布不可区分是操作化定义以 top-k 重叠与 benchmark 增益为判据非严格分布等价。成本章偏现象学奖励质量衰减的因果归因长度教师置信度标注噪声尚未被完全隔离。Self-distillation 外推论文提及单模型 特权信息的自蒸馏方向但本文实验以异模型师生为主结论不能直接套用。配方超参cold start 步数、top-k 的 k、OOD 混合比例论文未给出跨场景稳健的默认值。