
标题TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts来源arXiv, 2608.22788v2️文章简介研究问题在LLM同步Rollout训练中如何消除由少量极长生成请求导致的步骤级最大完成时间Makespan瓶颈主要贡献提出TailSieve框架利用部分Rollout作为无训练信号的长尾识别机制联合优化尾部分离与副本负载平衡显著提升推理速度。重点思路理论分析表明长尾场景下的最优路由策略是“尾部分离加负载均衡”即将极长请求隔离至低并发副本并分配少量平衡流量使各副本完成时间对齐。利用长尾Prompt在策略更新间具有稳定性的特点使用部分Rollout中未完成的请求组作为下一轮长尾候选集的无训练信号避免引入额外的长度预测模型。设计分层控制器动态调整系统内层循环根据池完成时间平衡隔离的请求数量外层循环基于边际容量压力调整分配给尾部池的副本数量以适应工作负载变化。所有被选中的长尾请求均在当前策略下从头重新生成不重用之前的KV Cache或轨迹从而保持On-policy生成特性避免引入路由导致的长度偏差。结合路由专用的投机解码技术在高并发的Bulk池使用保守策略在低并发的Tail池使用更激进的投机深度进一步挖掘加速潜力。分析总结在仅路由优化的情况下TailSieve相比均匀分组路由实现了最高1.67倍的加速比有效缓解了长尾请求对整体进度的阻塞。当结合MTP或DFlash等投机解码技术时由于Tail池的低并发环境更适合激进投机系统整体获得了最高2.59倍的端到端加速效果。在GRPO强化学习训练实验中TailSieve在策略演化过程中持续保持加速优势且下游任务准确率与基线相当证明其未损害模型训练质量。实验验证了分层控制器的收敛性无论从何种初始配置开始系统都能快速收敛到最优的隔离数量和副本分配比例。个人观点论文从一种异步执行机制转化为一种高效的长尾信号检测器把长尾 prompt 路由到专门的副本重新生成。