Reasoning RL:从奖励信号到可训练推理能力

发布时间:2026/7/27 8:58:57
Reasoning RL:从奖励信号到可训练推理能力 0. 为什么 Reasoning RL 改变了游戏规则过去一年大模型的推理能力发生了质的变化。这个变化不是来自更大的参数量或更多的训练数据而是来自训练范式的根本转变用可验证的奖励信号训练推理链本身。在此之前我们主要依赖提示工程来引导模型表现得像在思考但模型的推理能力并没有通过训练得到真正的强化。而现在通过将推理过程的成功与否作为训练目标模型能够在大量尝试中学会更有效的推理策略这标志着从模拟推理到学习推理的重大跨越。传统的提示工程让模型表现得像在思考——我们写 Chain-of-Thought 提示期望模型输出中间步骤我们用 Self-Consistency 让模型多采样几条路径再投票我们设计 Tree-of-Thought 让外部搜索器选择候选步骤。这些方法在实践中确实展现了效果能够在一定程度上引导模型产生更合理的推理过程。但本质上搜索结构主要在模型外部模型本身仍然是一个条件文本生成器其内在的推理能力并未通过训练得到根本性的提升。Reasoning RL 的核心突破是把推理链是否到达正确结果变成训练目标。数学题可以检查答案等价代码题可以跑测试逻辑题可以用规则验证。模型在大量候选路径中得到奖励和惩罚逐渐学会哪些推理行为更可能成功。直观理解过去我们在提示框里要求模型思考现在用奖励机制训练模型真的把计算资源分配到更有用的路径上。本文将围绕 Reasoning RL 的核心机制与工程实践深入探讨四个关键问题。这些问题不仅涉及理论突破更关系到实际系统的可复现性、稳定性和部署效率。在当前大模型推理能力竞争日益激烈的背景下理解这些问题对于构建可靠的推理系统至关重要。通过分析这些问题我们希望帮助读者建立从算法原理到工程实践的完整认知链条。1. 从提示工程到奖励驱动推理能力的训练化1.1 传统推理方法的边界Chain-of-Thought (CoT) 让模型写出中间步骤Self-Consistency 让模型多采样几条路径再投票Tree-of-Thought (ToT) 和 MCTS 类方法把候选步骤交给外部搜索器选择。这些方法在各自的应用场景中都展现了价值能够引导模型产生更结构化的输出。然而这些方法的共同点是搜索结构在模型外部模型仍然只是条件文本生成器。模型本身并没有通过训练学会如何更好地进行推理而只是在外部框架的引导下生成文本。为了更清楚地理解这些传统方法的局限性我们需要深入分析每种方法的运作机制及其根本缺陷。通过对比这些方法在推理能力培养上的不同表现可以发现它们都未能真正解决如何让模型学会推理这一核心问题。下面我们逐一剖析每种方法的具体问题所在CoT Prompting链式思考提示在提示词中要求模型一步一步思考或让我们逐步分析模型确实会输出更长、更结构化的文本看起来像是在进行推理。然而这种方法的根本问题在于模型并没有接收到关于这一步推理是否正确的明确训练信号。模型只是学会了生成符合推理格式的文本而不是真正理解推理的逻辑。这就像是让学生背诵解题步骤而不是教会他们理解解题思路——当遇到新题型时背诵的步骤往往无法迁移应用Self-Consistency自洽性方法这种方法通过采样生成多条不同的推理链然后对这些推理链的最终答案进行投票选择出现频率最高的答案作为最终结果。这种多数投票机制在一定程度上能够过滤掉错误的推理路径提高答案的可靠性。然而其核心问题依然存在每条推理链的生成过程仍然没有接收到梯度反馈信号。模型不知道哪条推理链更优、为什么更优也无法从投票结果中学习到改进推理策略的经验。这就像是通过少数服从多数来做决策但从未告诉决策者如何提高决策质量ToT / MCTS思维树/蒙特卡洛树搜索这类方法引入了外部搜索器如专门训练的value function或用LLM-as-judge评分器来评估推理过程中的中间状态通过评估不同推理分支的价值来指导搜索方向。这种方法在推理规划上确实更加系统化能够在多条候选路径中选择更有希望的方向继续探索。然而其根本局限在于这些外部评估信号虽然能够指导当前推理过程的搜索策略但并不会直接改进模型本身的推理能力。模型依然是被动地生成候选步骤而不是主动学习如何生成更优质的推理路径。这就像是给学生配备了一位导师来评判每一步是否正确但学生本身并没有从这些评判中内化推理能力这些基于提示工程的推理方法在实践中确实能够提升模型表现在许多任务上取得了显著效果。然而深入分析就会发现它们都面临着两个根本性的局限。之所以说这些局限是根本性的是因为它们源于方法本身的设计理念——即通过外部引导而非内在学习来实现推理能力。这些局限制约了推理能力的进一步提升和泛化推理能力不可迁移同一个模型在换了提示词或换了任务后推理质量可能显著下降。这是因为模型并没有真正学会推理而只是学会了在特定提示格式下生成看起来像推理的文本。一旦提示词风格改变或者任务类型与训练示例不同模型的推理表现就会大幅退化。计算浪费在无效路径模型不知道哪些推理步骤更可能成功平等地分配计算资源到所有可能路径。这意味着模型在生成推理链时无法有效地剪枝那些明显不会成功的路径也无法优先探索更有希望的方向导致大量计算资源被浪费在低质量的候选答案上。1.2 Reasoning RL 的范式转变Reasoning RL 的核心思想非常直接却带来了根本性的突破把推理链是否成功变成可优化目标。这意味着我们不再仅仅依赖提示词来诱导模型生成推理步骤而是通过强化学习的奖励机制让模型在大量尝试中学会哪些推理路径更有效。这种方法的优势在于模型能够自主探索和发现有效的推理策略而不是被动地模仿人工设计的推理模板。那么Reasoning RL究竟如何实现这一根本性突破其训练流程与传统方法相比发生了哪些本质变化理解这些变化对于把握整个技术路线至关重要。从技术实现角度看Reasoning RL的训练流程可以分解为以下四个核心环节这四个环节构成了一个完整的闭环学习系统采样多条推理链Rollout Generation对同一个问题让模型生成多条可能的推理路径rollouts这个过程类似于头脑风暴——模型不是只生成一条推理链而是探索多种可能的解题思路。通过多样化的采样模型能够覆盖不同的推理策略包括直接推理、逐步分解、反向验证等多种路径。这种多样性是后续优化的基础因为只有当模型探索了足够丰富的推理空间才能从中识别出哪些路径更有效用可验证奖励打分Reward Calculation对每条生成的推理链使用客观、可验证的标准进行评分。这里的可验证是关键——不同于模糊的人工评判这些奖励信号是明确且自动化的数学题通过符号等价性检查答案是否正确代码题通过运行单元测试验证功能是否实现逻辑推理题通过形式化规则验证推理是否有效。这种可验证性确保了奖励信号的一致性和可扩展性使得大规模训练成为可能。每条推理链最终会得到一个明确的奖励分数反映其质量高低策略梯度更新Policy Gradient Update基于奖励分数使用策略梯度算法更新模型参数。核心机制是奖励高的推理链其生成概率会被增强奖励低的推理链其生成概率会被抑制。这个过程是通过反向传播实现的——模型会学习到哪些token序列组合、哪些推理模式、哪些中间步骤更容易导向正确答案。与监督学习不同的是这里没有标准答案的推理链模型完全根据最终结果的好坏来调整生成策略。这种学习方式使得模型能够自主发现有效的推理模式而不是简单地模仿人类提供的示例迭代收敛Iterative Convergence重复上述三个步骤模型在推理空间中的策略逐渐优化最终收敛到一个高效的推理模式。在这个迭代过程中模型不仅学会了如何得到正确答案更重要的是学会了如何在推理空间中分配计算资源——对于简单问题快速响应对于复杂问题分配更多推理步骤对于不确定的地方增加验证和回溯。这种动态资源分配能力是通过大量迭代训练涌现出来的体现了模型对推理任务本质的理解。随着训练的进行模型的推理链质量会持续提升最终达到稳定的高性能状态关键区别在于奖励信号直接作用于推理链生成过程而不是只作用于最终答案。模型不仅学会这道题的答案是 42更学会用什么样的推理步骤更可能到达正确答案。这种学习方式使得推理能力成为模型的内在能力而不仅仅是对特定提示格式的记忆。通过大量的试错和奖励反馈模型逐渐内化了有效推理的模式能够在新任务上展现出更强的泛化能力。这就像是从背诵解题步骤升级到理解解题思路。DeepSeek-R1 的摘要明确强调推理能力可以通过纯强化学习激励出来而不必依赖人工标注的 reasoning trajectories。论文还指出训练过程中出现了自我反思、验证和动态策略调整等模式——这些行为不是人工模板写进去的而是模型在奖励压力下发现多算一步、检查一步、换个角度更容易拿到正反馈。1.3 思考预算的动态分配Reasoning RL 的真正价值不是让所有回答都变得更长而是让模型学会把计算资源token花在真正能降低错误率的位置。这意味着模型需要具备元认知能力知道什么时候需要深度思考什么时候可以快速回答。对于简单的事实查询模型应该直接给出答案而不浪费时间在不必要的推理上而对于复杂的数学证明或多约束规划问题模型则应该愿意分配更多的计算预算来探索和验证推理路径。这种动态的资源分配能力是推理系统实用化的关键。Qwen3 技术报告和官方博客把 thinking mode 与 non-thinking mode 放到统一框架中强调推理模式的选择应该是动态的、任务相关的简单任务应该快速回答对于事实查询、短文本改写、简单解释等任务长链推理不仅不会提升准确率反而会增加延迟和成本。模型应该能够识别这些任务的特征直接给出答案而不进入推理模式。复杂任务值得分配推理预算对于数学证明、跨文件代码调试、多约束规划问题、需要探索多种可能性的代码生成等任务分配更多的推理 token 预算往往能够显著提升最终质量。这类任务的特点是存在多个可能的路径需要验证和回溯。这个判断对工程系统的架构设计至关重要长推理是昂贵的计算资源不是用来装饰回答的默认选项。在实际部署时系统需要综合考虑多个维度来动态选择推理模式任务类型是否需要多步推导、历史错误率该类任务的难度、用户延迟要求实时对话 vs 批处理分析、问题所属领域数学、代码、常识以及安全等级高风险决策需要更谨慎的推理。这种动态路由机制是推理系统从实验室原型走向生产部署的关键工程决策。defchoose_reasoning_budget(task:str,context:dict)-int: 根据任务特征动态分配推理 token 预算。 这是工程化示意不代表任何具体模型的内部实现。 # 硬信号明确需要推理的关键词hard_signals[证明,推导,竞赛,复杂代码,多约束,反例,调试]ifany(signalintaskforsignalinhard_signals):return4096# 高预算# 任务长度iflen(task)500:return2048# 中预算# 历史失败率ifcontext.get(historical_error_rate,0)0.3:return2048# 中预算# 默认快速回答return512# 低预算2. DeepSeek-R1长链推理如何涌现2.1 R1-Zero 的问题设定DeepSeek-R1-Zero 的实验设计体现了一个极简主义的研究思路它试图回答一个纯粹的科学问题如果不给模型提供人工精心编写的长链 CoT 示范只提供可验证任务的最终奖励信号答案对不对模型能不能自己学会生成更长、更有效的推理过程这个问题的答案将直接揭示推理能力是否可以通过纯强化学习激励出来而不必依赖昂贵的人工标注推理轨迹。论文和官方仓库的说明显示R1-Zero 从 base model未经过指令微调的基础模型出发直接进行大规模强化学习训练完全跳过了传统的监督微调SFT阶段。它采用的优化算法是GRPOGroup Relative Policy Optimization组相对策略优化这是一种针对大语言模型推理任务特点设计的高效算法对同一个 prompt 采样一组输出Group Sampling通常生成 16-32 条推理链这些推理链构成一个同组样本集。这种批量采样策略不仅提高了样本效率更重要的是为后续的相对比较创造了条件。同组样本面对的是完全相同的问题它们之间的质量差异直接反映了不同推理策略的优劣。通过在组内进行比较模型可以学习到在相同起点下哪种推理路径更有效而不是简单地学习这道题的标准答案是什么用组内奖励做相对优势估计Relative Advantage Estimation计算每条推理链的奖励分数后不是直接用绝对奖励值来指导优化而是先在组内进行归一化处理计算每条推理链相对于组内平均水平的优势。这种相对优势估计的核心思想是“重要的不是这条推理链得了多少分而是它比同组其他推理链好多少”。通过这种组内归一化模型学到的不是如何解决简单题或如何解决难题而是面对同一道题什么样的推理策略更有效。这种相对比较机制大大提高了训练的稳定性和样本效率省掉 PPO 常见的 value modelValue-Free Optimization这是GRPO相对于传统PPO算法最重要的工程创新。传统的PPO需要训练一个单独的价值网络value model来估计每个状态的长期价值这个价值网络与策略网络一样大几乎使训练成本翻倍。GRPO通过组内相对比较机制直接从奖励信号中估计优势函数完全不需要额外的价值网络。这不仅节省了大量计算资源和显存也避免了价值网络训练不稳定带来的问题。对于大规模语言模型的推理训练来说这种简化使得工程实现变得更加可行直观理解 GRPO 的核心思想在评估同一道题的多个候选答案时不仅要看每条答案的绝对得分更要关注它相对于同组其他候选答案的表现如何。这种相对比较的策略带来了多个工程优势使得大规模推理训练更加可行不需要单独训练 value model显著节省计算资源传统的 PPO 算法需要额外训练一个价值网络来估计状态价值这会使训练成本翻倍。GRPO 通过组内相对比较直接估计优势省去了这个昂贵的组件。相对优势估计更加稳定同组样本共享难度基线同一个 prompt 生成的所有候选答案面对的是同一道题它们的难度是一致的。通过组内归一化模型学到的是什么样的推理策略更好而不是这道题简单还是难。可以有效处理稀疏奖励场景只要组内存在差异即可即使大部分候选答案都失败了只要有少数几个成功或者失败的程度有所不同归一化后仍然能产生有意义的梯度信号。2.2 GRPO 的组内相对优势importnumpyasnpdefgrpo_group_advantages(rewards:list[float],eps:float1e-6)-np.ndarray: GRPO 的组内优势归一化。 Args: rewards: 同一个 prompt 的多条 rollout 的奖励例如 [1, -1, -1, 1, -1, 1, -1, 1] eps: 数值稳定性参数 Returns: 归一化的优势值用于策略梯度更新 rnp.asarray(rewards,dtypenp.float32)# 组内归一化减均值除标准差return(r-r.mean())/(r.std()eps)# 示例同一道题的 8 条推理链rewards[1,-1,-1,1,-1,-1,-1,1]# 4 条成功4 条失败advantagesgrpo_group_advantages(rewards)print(advantages)# 输出约为[1.06, -0.71, -0.71, 1.06, -0.71, -0.71, -0.71, 1.06]# 成功的链得到正优势失败的链得到负优势这个归一化机制的关键洞察在于通过组内相对比较来估计优势而不是依赖绝对评分。这种设计的优雅之处在于其鲁棒性即使所有候选答案的奖励都是 -1全部失败只要它们之间存在细微的质量差异比如某条推理链虽然最终答案错误但中间步骤更接近正确方向归一化后仍然能产生有意义的优势估计。这意味着即使在训练早期模型表现很差的阶段GRPO 也能从失败的尝试中提取学习信号引导模型朝着更好的方向改进。2.3 长链推理为什么会涌现R1-Zero 最具研究价值的发现是训练过程中自发涌现了更长的推理链以及自我验证、回溯、替代解法等复杂推理行为。这些现象的重要性在于它们不是通过人工设计的提示模板或监督数据教给模型的而是模型在纯粹的奖励优化压力下自主发现并采用的有效策略。这些复杂推理行为的出现并非偶然而是模型在奖励压力下发现的理性选择。换句话说模型通过大量的试错学习逐渐发现某些推理策略如自我验证、回溯修正能够更稳定地获得正奖励因此这些策略在训练过程中被不断强化。从优化目标的角度分析我们可以理解为什么这些行为会自然涌现多算一步的收益在关键步骤后增加验证步骤模型可以及早发现错误并修正从而提高最终奖励检查的边际价值当模型不确定时写出让我检查一下并重新推导比直接猜测更可能得到正奖励换个角度的探索如果当前路径卡住尝试替代方法换公式、换坐标系可能打开新路径奖励塑造的自然结果更长的推理链意味着更多修正机会只要最终答案对中间的探索成本被摊销2.4 从能力涌现到可用模型纯强化学习训练也暴露了明显的工程问题。DeepSeek 官方仓库坦诚地指出R1-Zero 存在语句重复、可读性差和中英文混杂等影响用户体验的问题。这些问题虽然不影响最终答案的正确性却严重制约了模型作为实用助手的可用性。从实际应用的角度看一个推理正确但表达混乱的模型往往难以获得用户信任也不便于后续的审计和调试。这些可用性问题的存在凸显了从实验室原型到生产系统之间的巨大鸿沟。问题的根源并不难理解如果奖励函数主要关注最终答案的正确性和基本格式规范模型就会优先优化答对题这个目标而不会主动优化让人类读得清楚、舒服这个维度。在奖励信号的引导下模型学会了有效推理但没有学会优雅表达。这个现象恰好解释了为什么正式版 DeepSeek-R1 不是坚持纯 RL 到底的理想主义路线而是务实地引入了多阶段工程化流程。正式版 DeepSeek-R1 采用了一个精心设计的多阶段训练流水线将纯强化学习的能力涌现与工程化的可用性保障相结合。这个流水线不是简单的线性堆叠而是在不同阶段有针对性地解决特定问题从格式规范、能力强化、模式固化到通用性保持每个阶段都有明确的目标和数据策略阶段作用数据来源训练方法Cold-start SFT提供可读格式基础少量人工标注高质量推理示例监督微调推理专项 RL强化数学/代码/逻辑能力领域任务数据集GRPO 领域奖励拒绝采样 SFT固化高质量推理模式RL 轨迹中筛选高分样本监督微调通用能力混合保持对话和事实问答能力混入通用任务数据监督微调后续 RL兼顾推理和对齐推理 对齐混合数据GRPO 混合奖励从工程实践的角度来看更准确的表述应该是R1-Zero 通过纯强化学习实验证明了推理能力可以自然涌现而正式版 R1 则是将这种原始的能力打磨、规范和整合最终转化为一个可用性更高、交互体验更好的实用助手模型。这个从原型到产品的转化过程体现了理想与现实之间的平衡也揭示了将研究成果工程化所必须跨越的鸿沟不仅要追求能力的上限更要确保能力的稳定性、可控性和用户体验。3. DAPO推理训练的系统工程化3.1 复现问题比算法口号更重要在 DeepSeek-R1 展示了推理能力涌现的可能性之后AI 社区面临的核心挑战已经从强化学习对推理任务有没有用转变为更加实际的工程问题“我们能不能稳定地训练出这样的模型、能不能在不同环境下复现结果、训练过程中的指标是否真实反映了推理能力的提升”。这些问题直接关系到 Reasoning RL 能否从少数顶尖实验室的研究成果转变为更广泛的社区可以实践和应用的技术。DAPO 项目的论文标题开门见山地表明了其定位DAPO: An Open-Source LLM Reinforcement Learning System at ScaleDAPO大规模开源大语言模型强化学习系统。算法名称展开为Decoupled Clip and Dynamic Sampling Policy Optimization解耦裁剪与动态采样策略优化。论文摘要清晰地指出了当前推理模型训练面临的核心挑战推理模型的关键训练细节往往没有完全公开社区很难复现大规模 RL 结果DAPO 开放训练代码、基于 verl 的系统、处理后的数据集在 Qwen2.5-32B base 上报告达到 AIME 2024 50 分——这一成绩具有重要的标志性意义。AIME美国数学邀请赛是面向高中生的顶级数学竞赛满分75分而50分已经超过了大多数人类参赛者的水平。更重要的是这个结果是在相对较小的32B参数模型上实现的证明了DAPO训练系统的高效性。此外这一成绩的可复现性得到了验证——DAPO团队公开了完整的训练代码、数据处理流程和系统架构使得社区成员能够在类似的资源条件下重现这一结果这对于推动开源AI生态的发展具有重大价值DAPO 最值得学习的不是某个单点技巧而是把 reasoning RL 训练拆成可监控系统。这种系统化的思路意味着训练过程不再是一个黑盒而是被分解为多个可观测、可调控的模块每个模块都有明确的输入输出和质量指标当训练出现问题时可以快速定位是哪个环节出了问题。这种工程化的视角将能否训练出推理能力这个科学问题转化为如何稳定、可复现地训练推理能力这个工程问题为实际部署奠定了基础。3.2 DAPO 的四个核心机制机制问题解决方案效果Clip-HigherPPO 的对称 clip 限制高优势动作更新解耦上下 clip高优势动作可以有更大更新空间加速收敛提高峰值性能Dynamic Sampling全对或全错的组无法提供有效梯度过滤全对/全错组确保组内有成功和失败减少无效样本提高训练效率Token-Level Policy Gradient长序列的 token 梯度信号被稀释让每个 token 更直接参与损失统计长链推理训练更稳定Overlong Reward Shaping推理链撞到最大长度导致奖励噪声对超长样本的奖励做特殊处理减少长度偏置直观理解模型会不会推理是一回事训练过程能不能稳定地产生有效梯度又是另一回事。即使我们已经证明了强化学习可以激发模型的推理能力但在实际训练中梯度的方差、采样效率、奖励信号的稀疏性等问题仍然会严重影响训练的稳定性和收敛速度。DAPO的四个核心机制正是针对这些训练工程问题提出的解决方案它们共同确保训练过程能够稳定地将奖励信号转化为模型能力的提升。3.3 动态采样的代码示例动态采样的核心思路全对样本和全错样本都不一定提供有效相对信息。全对说明题可能太简单模型已经掌握继续训练这类样本无法带来新的学习信号全错说明当前策略还找不到路径强行训练可能引入噪声梯度。真正有训练价值的是同题下既有成功也有失败的 rollout因为这种对比能够清晰地告诉模型哪些推理路径更可能成功从而产生有效的策略改进信号。defkeep_prompt_for_training(rewards:list[int])-bool: 动态采样的核心判定同组里至少要有成功和失败。 Args: rewards: 同一个 prompt 的所有 rollout 的奖励值 Returns: True 表示保留这个 prompt 的样本用于训练 has_successany(r0forrinrewards)has_failureany(r0forrinrewards)returnhas_successandhas_failuredefdynamic_sample(prompt,model,reward_fn,group_size16,max_rounds4): 动态采样持续采样直到组内既有成功也有失败或达到最大轮次。 Args: prompt: 输入问题 model: 策略模型 reward_fn: 奖励函数 group_size: 每轮采样数量 max_rounds: 最大采样轮次 Returns: (rollouts, rewards) 或 (None, None) 如果无法满足条件 rollouts[]rewards[]forround_idxinrange(max_rounds):# 采样一批新的 rolloutnew_outputsmodel.sample(prompt,ngroup_size)rollouts.extend(new_outputs)rewards.extend([reward_fn(prompt,y)foryinnew_outputs])# 检查是否满足条件ifkeep_prompt_for_training(rewards):returnrollouts,rewards# 达到最大轮次仍未满足条件丢弃这个 promptreturnNone,None3.4 GSPO 的序列级优化GSPO 的问题意识又往前推了一步。很多 RL 训练里奖励是给整条 response 打分但 importance ratio 却在 token 级计算。这种粒度不匹配带来的问题在长链推理场景下尤为突出我们用一个总体奖励信号来评价整条推理链的质量却在每个token的层面独立计算策略变化程度这导致优化目标与评估粒度之间存在根本性的脱节。GSPO正是针对这一问题提出的解决方案将优化粒度提升到与奖励粒度相匹配的序列级别。对短回答来说这个错配还能被噪声掩盖对长链推理、MoE 架构和大规模训练来说token 级 ratio 会带来更高方差每个 token 的新旧策略概率比独立计算长序列累积误差基础设施负担需要存储和计算每个 token 的 logprob优化粒度不匹配奖励看整条链但更新看每个 tokenQwen 团队提出的GSPOGroup Sequence Policy Optimization把 importance ratio 提升到 response 级从根本上解决了粒度不匹配的问题。这种设计的核心思想是既然我们用一个总体奖励来评估整条推理链那么在计算策略变化时也应该在整条推理链的层面进行衡量而不是让每个token独立承担高噪声的校正信号。具体来说GSPO实现了以下机制用整条响应的新旧策略似然差做长度归一化做序列级 clipping、rewarding 和 optimization在计算策略梯度时所有关键操作都在序列级别进行。Clipping裁剪限制整条推理链的策略变化幅度防止单次更新改变过大Rewarding奖励分配基于整条推理链的最终结果Optimization优化针对整条序列的生成概率进行梯度更新。这种序列级的统一处理方式使得优化目标与评估标准保持一致避免了token级操作带来的粒度不匹配问题。相比传统方法对每个token独立进行裁剪和更新序列级操作能够更好地捕捉推理链的整体质量减少优化过程中的方差与奖励粒度对齐奖励评估整条链优化也在整条链层面importmathdefgspo_sequence_ratio(new_logprobs:list[float],old_logprobs:list[float])-float: GSPO 序列级 importance ratio。 Args: new_logprobs: 同一条 response 每个 token 在新策略下的 log probability old_logprobs: 同一条 response 每个 token 在旧策略下的 log probability Returns: 序列级的 importance ratio长度归一化后 assertlen(new_logprobs)len(old_logprobs),长度必须一致# 平均 log ratio长度归一化mean_log_ratiosum(n-oforn,oinzip(new_logprobs,old_logprobs))/len(new_logprobs)# 转换回概率空间returnmath.exp(mean_log_ratio)defgspo_clipped_objective(seq_ratio:float,advantage:float,eps:float0.2)-float: GSPO 的 clipped objective序列级。 Args: seq_ratio: 序列级 importance ratio advantage: 序列级优势值 eps: clip 范围 Returns: clipped objective value # 标准 PPO clipclipped_ratiomin(max(seq_ratio,1-eps),1eps)# 取两者最小值悲观估计returnmin(seq_ratio*advantage,clipped_ratio*advantage)3.5 工程启发优化粒度贴近奖励粒度从工程角度看GSPO 的启发是优化粒度要贴近奖励粒度。这个原则对于设计可靠的强化学习训练系统具有重要的指导意义。当奖励信号和优化机制工作在不同的抽象层次上时训练过程容易出现信号失配、梯度方差过大等问题。因此在设计训练流程时应该确保评估模块如verifier、reward model与优化模块如policy gradient计算在同一粒度上协同工作从而提高训练的稳定性和效率。如果 verifier 判断的是整条推理链是否成功那么更新时也应该更关心整条链是否仍在可信的策略变化范围内而不是让每个 token 独自承担高噪声校正。这种粒度对齐的设计哲学不仅适用于GSPO也为其他强化学习训练系统提供了有价值的参考当我们用序列级的成功标准来评估模型时优化器也应该在序列级别控制策略更新的幅度避免token级的细粒度操作带来的累积误差和方差放大。Qwen 官方博客在介绍GSPO时特别强调了几个在工程实践中至关重要的优势这些优势不仅关乎训练效果更直接影响到大规模部署的可行性。作为全球领先的开源大模型团队Qwen的实践经验具有很高的参考价值。他们的观察表明GSPO 对 MoEMixture of Experts专家混合模型训练更稳定——这一点对于大规模模型部署尤为关键。MoE架构通过动态路由机制激活不同的专家模块在推理效率和模型容量之间实现了良好平衡但这种动态性也给强化学习训练带来了额外的稳定性挑战。GSPO的序列级importance ratio设计能够更好地适应MoE的路由波动避免token级操作在专家切换时产生的梯度不稳定问题使得训练过程更加平滑可控可能减少 Routing Replay 和训练引擎重算 logprob 的基础设施压力…详情请参照古月居