字节:两阶段RL激活大模型参数知识

发布时间:2026/8/30 16:09:02
字节:两阶段RL激活大模型参数知识 标题From Storage to Access: Verifiable Activation of Parametric Knowledge in LLMs via Explicit Priming and Implicit Reasoning来源arXiv, 2608.18581v1️文章简介研究问题如何解决大语言模型中参数化知识“存储但不可访问”的瓶颈并区分知识召回与推理过程主要贡献论文提出VAKE框架通过显式引导和隐式推理两阶段强化学习有效激活并验证大模型内部的潜在参数知识。重点思路构建两阶段强化学习框架VAKE将知识激活与答案推理分离。第一阶段为显式引导Priming第二阶段为隐式推理Reasoning旨在解决传统端到端方法中知识提取与推理纠缠的问题。在Priming阶段策略模型针对稀疏检索子图生成桥接三元组作为显式证据。利用一个冻结的独立问答模型基于增强后的子图生成答案并提供奖励确保奖励信号直接归因于插入的知识三元组实现可验证的知识激活。在Reasoning阶段将Priming阶段学到的策略初始化参数通过GRPO算法训练模型直接基于原始输入进行思维链推理。此阶段测试显式知识提取能力是否能迁移至隐式推理中无需再插入显式三元组即可正确作答。设计基于结果的可解释奖励机制结合精确匹配和Token级F1分数并加入格式约束惩罚优化策略模型在三元组生成和直接推理中的表现确保输出结构的规范性与答案的正确性。分析总结VAKE在多个多跳和单跳问答基准测试中 consistently 优于标准基线及现有RL方法且在分布外数据集上表现出良好的泛化能力证明其激活的知识具有通用性而非过拟合特定数据关联。归因分析显示超过80%由VAKE插入的桥接三元组源自模型参数而非检索上下文且半数以上是通过直接提示无法获取的知识证实了该方法确实激活了潜在的参数化知识而非简单复制外部信息。消融实验表明Priming和Reasoning阶段具有互补性。即使在不插入显式三元组的直接推理设置下经过VAKE训练的模型性能仍显著优于仅使用GRPO或基础模型说明显式激活阶段有效提升了模型的隐式推理能力。该框架在不同规模的模型 backbone 上均保持稳定增益且在数学、指令遵循等通用能力评估中与基线持平证明其在提升事实问答能力的同时未损害模型的其他核心能力。个人观点论文借鉴认知科学中的“启动效应”通过引入冻结模型作为裁判将黑盒式的知识回忆转化为可观测、可验证的显式三元组插入过程解决了强化学习中奖励归因模糊的难题。