【ICLR 2026】AgentFlow:流内智能体系统优化,多轮闭环中的规划与工具使用|从LLM智能体训练视角

发布时间:2026/10/5 10:31:41
【ICLR 2026】AgentFlow:流内智能体系统优化,多轮闭环中的规划与工具使用|从LLM智能体训练视角 摘要本文解读 ICLR 2026 论文《In-the-Flow Agentic System Optimization for Effective Planning and Tool Use》。该论文提出AgentFlow——一个可训练的在流in-the-flow智能体系统通过融合四模块演化记忆架构、Flow-GRPO 在线策略优化与广播式轨迹级信用分配让规划器在真实多轮循环内部被直接优化其特别之处在于把长程稀疏奖励下的多轮强化学习严格等价为一系列可处理的单轮策略更新。实验表明7B 规模的 AgentFlow 在搜索 57.3%、智能体 33.1%、数学 51.5%、科学 63.5% 四个域全面超过约 200B 参数的 GPT-4o较冻结规划器平均提升 17.2 个百分点为工具增强的大模型与多轮智能体训练提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQAgentFlow 与 Search-R1、ToRL 这类工具集成 RL 有什么本质区别Flow-GRPO 为什么把同一条轨迹的所有轮次给同一个奖励为什么离线监督微调SFT会崩溃 19 个百分点AgentFlow 用的是多大的模型需要多少算力这套方法对实际部署最直接的价值是什么论文有没有明显的不足参考链接论文基本信息项目内容标题英文In-the-Flow Agentic System Optimization for Effective Planning and Tool Use标题中文流内智能体系统优化多轮闭环中的规划与工具使用作者Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu机构Stanford University · Texas AM University · UC San Diego · Lambda会议ICLR 2026arXivarXiv:2510.05592项目网站agentflow.stanford.edu · 代码 lupantech/AgentFlow背景与动机基于结果反馈的强化学习RLVR已经显著提升了推理大模型的能力而工具增强web search、代码执行进一步把可验证奖励从纯推理扩展到检索与计算。但主流做法——工具集成推理——训练的是一个单一而庞大的策略它在同一条完整上下文轨迹 $\tau {s^1, a^1, e^1, \ldots, s^T, a^T}$ 里交错生成思考与工具调用其中 $s^t$ 是上下文、$a^t$ 是动作、$e^t$ 是工具返回结果。这种单体范式在长horizon与多工具场景下扩展性很差迁移到新场景也容易失效。智能体系统agentic systems提供了另一条路径把工作分解到多个专用模块——规划器、执行器、验证器、生成器——再通过共享记忆协调。问题在于这类系统绝大多数要么完全不训练AutoGen、MetaGPT、OctoTools 靠人工编排与提示要么只在离线数据上训练MALT、MAPoRL、MARFT 在静态轨迹上做监督微调或偏好优化。两者都与多轮交互的实时动力学脱节离线目标与轨迹级的任务成败并不对齐模块之间也无法在部署时共同适应。把这个问题放进历史脉络会更清楚2024–2025 年的主线是单体工具集成推理 RLSearch-R1、ToRL、ReTool用结果奖励训练一个工具策略2025 年出现了训练-free 的多模块智能体模块冻结、靠提示编排与离线多智能体训练与在线动力学脱节这两类替代方案到 2026 年AgentFlow 把规划器放进真实多轮循环里做 on-policy 优化并已被智能体记忆综述引用为编排 共享工作区的代表系统。论文的核心主张很直接决定成败的不是模型有多强而是规划器能否与在线动力学共同适应。图 1左图为 7B 主干在十个推理基准上经 Flow-GRPO 调优前后的表现规划质量与工具调用可靠性同步提升右图为 AgentFlow 相对基座 LLM、工具集成 RL 模型与训练-free 智能体的持续增益。图 2两种工具使用范式的对比。(a) 单体工具集成推理模型单一策略在同一完整上下文中交错思考与工具调用(b) 智能体系统任务分解到多个专用模块协作但通常训练-free、由手写逻辑或提示编排。研究主线从问题到结论图 13Mermaid 流程图AgentFlow 的研究主线——单体工具策略在长horizon与多工具下失效引出四模块智能体系统与在流训练规划器最终以广播式最终奖励在四个域超过 GPT-4o。基准/方法设计AgentFlow 把解题过程形式化为一个多轮马尔可夫决策过程。给定查询 $q$ 与工具集 $K$第 $t$ 轮的状态是 $s^t (q, K, M^t)$其中 $M^t$ 是当轮之前的记忆状态$M^1$ 由 $q$ 初始化规划器可训练策略 $\pi_\theta$据此产出动作 $a^t \sim \pi_\theta(a^t \mid q, K, M^t)$。系统由四个专用模块组成只有规划器带可训练参数Action Planner规划器 $\mathcal{P}$唯一可训练的模块负责分解子目标、选择工具、从记忆中检索上下文。Tool Executor执行器 $\mathcal{E}$调用被选中的工具返回执行观测 $e^t \sim \mathcal{E}(e^t \mid a^t, K)$。工具集包含 Base Generator默认推理引擎、Python Coder、Google Search、Wikipedia Search 与 Web Search 五个。Execution Verifier验证器 $\mathcal{V}$判断证据是否有效、累积记忆是否足以解题给出二元信号 $v^t \sim \mathcal{V}(v^t \mid q, e^t, M^t)$。Solution Generator生成器 $\mathcal{G}$终止时依据 $q$ 与 $M^T$ 生成最终解 $o \sim \mathcal{G}(o \mid q, M^T)$。记忆以确定性方式更新$M^{t1} f_{\text{mem}}(M^t, a^t, e^t, v^t)$记录子目标、工具名、命令、时间、轮次与错误信号等结构化字段。与隐藏在轨迹背后的潜思考不同这里的记忆是显式且可控的推理记录既保证可审计性也让上下文增长有界。整个过程重复直到 $v^t 1$终止或到达最大轮预算 $T_{\text{max}}$。图 3AgentFlow 总览。(a) 四个模块planner / executor / verifier / generator经共享演化记忆 $M$ 与工具集 $K$ 协作规划器策略在系统多轮循环内部做 on-policy 优化(b) 单步状态转移动作 $a^t$、执行结果 $e^t$、验证信号 $v^t$ 把记忆从 $M^t$ 更新到 $M^{t1}$。分类全景图 14Mermaid 分类图AgentFlow 的四模块分类全景——Action Planner 是唯一可训练的模块Tool Executor 掌管五个工具Execution Verifier 输出二元信号Solution Generator 依据累积记忆生成终解。方法细节Flow-GRPO 的关键是在流学习用当前策略在真实系统里完整 rollout采集它真正诱发的状态—动作—工具事件轨迹再用可验证的最终结果信号更新策略。这样暴露出来的状态就是推理时会遇到的状态训练分布与部署分布一致。最终结果奖励与广播。由于每个中间动作只间接影响最终解论文放弃脆弱的中间启发式改用轨迹级奖励$r R(a^t) \bar{R}(o, q, y^) \in {0,1}$对同一条轨迹内所有* $t$ 取相同值。$\bar{R}$ 由 GPT-4o 作为 LLM-as-judge判定语义、数值与选项层面的等价。组归一化优势。优势 $A_i^t$ 在同一 rollout 内对所有轮次恒定并按组归一化减组内均值、除组内标准差。这既降低方差也锐化了跨轨迹的信用分配。目标函数。目标对组、轮与 token 三层求平均逐 token 的重要性比 $\rho$ 被裁剪到 $[1-\epsilon, 1\epsilon]$乘上组归一化优势 $A_i^t$再减去到固定参考策略 $\pi_{\text{ref}}$ 的 KL 惩罚$\beta 0.001$。论文在附录中给出两个理论结果其一最大化多轮全局目标等价于在 on-policy 状态分布下最大化期望的 token 级单轮目标其二借用信赖域下界可得到单调改进保证即 $\mathcal{J}(\theta^{t1}) \ge \mathcal{J}(\theta^t)$。因此广播 组归一化不是启发式技巧而是一个有等价性证明与收敛保证的有效 surrogate。训练与评测配置附录细节。训练侧学习率 $1\times10^{-6}$、规划器采样温度 $0.5$、KL 系数 $\beta 0.001$、规划器最大输出 2048 token、rollout 轮数上限 3、8 张 A100、judge 为 GPT-4o、工具调用 500 秒超时评测侧轮数上限 $T_{\text{max}} 10$、温度 $0.7$所有工具的大模型初始化为 Qwen2.5-7B-Instruct。图 4AgentFlow 的优化流程给定查询 $q$、演化记忆 $M$ 与工具集 $K$策略模型生成面向子目标并选择工具的动作由 Flow-based Group Refined Policy OptimizationFlow-GRPO在多轮协同动力学下实现稳定优化。实验设计与结果实验覆盖四类推理任务、十个 benchmark知识密集搜索Bamboogle、2Wiki、HotpotQA、Musique后三者各采样 100 例、智能体推理GAIA 文本子集、逻辑密集数学AIME24、AMC23、GameOf24与科学推理GPQA 100 例、MedQA。四模块与工具统一用 Qwen2.5-7B-Instruct 实例化只有 Action Planner 可训练评测温度 0.7GPT-4o 作 LLM-as-judge全部结果取三次试验平均。为保证公平搜索增强模型的检索被统一替换为本文 Google Search代码模型被替换为本文 Python Coder。模型规模搜索平均GAIAGPT-4o~200B49.117.3Search-R17B-Inst33.319.1VerlTool7B-Base39.011.2AutoGen训练-free7B-Inst42.46.3AgentFlow未调优7B-Inst47.217.2AgentFlow Flow-GRPO7B-Inst57.333.1模型规模数学平均科学平均GPT-4o~200B35.145.5Luffy7B-Inst36.255.5TIR代码集成7B-Inst31.059.4ToRL代码 RL7B-Inst37.055.8AgentFlow未调优7B-Inst31.756.5AgentFlow Flow-GRPO7B-Inst51.563.5规划器训练策略消融回答瓶颈到底在哪规划器训练方式平均准确率相对冻结Qwen2.5-7BFrozen基线38.5—GPT-4oFrozen44.35.8Qwen2.5-7BOffline SFT19.5−19.0Qwen2.5-7BFlow-GRPO55.717.2工具使用随任务重分配。2Wiki 需要广域事实Google Search 调用率提升 42.0%MedQA 需要专深检索Google Search 从 66.2% 降到 10.9%让位给文档内 Web Search0→19.5%与专业 Wikipedia Search0→59.8%。在 Musique 上训练后规划器提高 Web Search 使用率以深入其他工具给出的 URL带来 6.1% 的稳定提升。缩放与效率。主干从 3B 扩到 7BFlow-GRPO 在两个规模上都带来一致增益把工具升级为 GPT-4o 版本后GAIA 1.0%、AMC23 6.0%、HotpotQA 13.0%规划器仍能继续受益。训练动力学上平均奖励持续上升、回答长度收敛变短而在 AIME24 上对比单体工具 RL 基线 ToRLAgentFlow 的验证准确率稳步上升、ToRL 则迅速停滞并掉头向下。图 5Flow-GRPO 微调前后的工具调用比例变化2Wiki 提升 Google SearchMedQA 则转向 Web Search 与 Wikipedia Search——规划器按任务特征重分配检索工具。图 6主干规模从 3B 扩到 7B 时Flow-GRPO 微调在各项任务上仍带来一致增益。图 7推理期轮预算 $T_{\text{max}}$ 从 3 增到 10 时平均准确率单调上升。图 8Flow-GRPO 训练动力学训练集平均奖励持续上升回答长度先升后收——兼顾简洁与信息量。图 9AIME24 上的训练效率对比AgentFlowFlow-GRPO验证准确率稳步上升ToRL 迅速停滞并下行。图 10案例研究左侧为陷入重复错误的初始轨迹右侧 Flow-GRPO 训练后的 AgentFlow 在两次失败后于第 4 轮探索出新的解法路径。图 11工具缩放研究把 Base Generator 与 Python Coder 升级为 GPT-4o 版本后AgentFlow 性能进一步提升——规划器能自适应吸收底层工具的能力增益。图 12Musique 上的工具调用优化Flow-GRPO 训练后规划器提高 Web Search 使用率以深入其他检索工具给出的 URL带来 6.1% 的稳定性能提升。结果对比总结图 15Mermaid 结果图AgentFlow 的结果对比——冻结规划器 38.5、离线 SFT 崩溃到 19.5、Flow-GRPO 提升到 55.7最终搜索平均 57.3 全面超过 GPT-4o。关键发现统一系统的跨域统治力7B 的 AgentFlow 在搜索 57.3%、智能体GAIA33.1%、数学 51.5%、科学 63.5% 四个域同时取得最强结果相对最强工具集成基线提升 14.9%搜索、14.0%智能体、14.5%数学与 4.1%科学并全面超过约 200B 的 GPT-4o增益区间 8.2%–18.0%。瓶颈是能否共同适应而不是模型多强换成 GPT-4o 作静态规划器只涨 5.8 个百分点把 GPT-4o 行为离线蒸馏成 SFT 反而崩溃 −19.0 个百分点只有在流 on-policy 的 Flow-GRPO 拿到 17.2 个百分点。规划器学会了按任务选工具2Wiki 的 Google Search 调用率 42.0%MedQA 的 Google Search 66.2%→10.9%Wikipedia Search 0→59.8%Musique 提升 Web Search 后性能 6.1%。正向缩放与可吸收的改进主干 3B→7B 增益单调轮预算 $T_{\text{max}}$ 从 3 增到 10 时所有任务单调提升平均轮数 2Wiki 2.22→4.44、GAIA 2.43→5.42工具升级到 GPT-4o 后 HotpotQA 再涨 13.0%。效率优于单体工具 RLFlow-GRPO 训练中平均奖励持续上升、回答长度收敛变短在 AIME24 上验证准确率稳步上升而 ToRL 很快停滞并下行。创新模式信号附录分析AgentFlow 同时命中三个顶会创新模式——重新表述为可解对象把多轮信用分配重述为单轮更新$\Delta_{\text{OR}}2.9$pp、$\Delta_{\text{OH}}7.1$pp 双赢、证明等价性以统一$\Delta_{\text{OR}}2.2$pp与分解并委托求解器$\tau6.3$pp增长最快执行质量由消融、效率曲线、工具缩放三条独立证据链支撑。局限性只训练规划器执行器、验证器与生成器全程冻结为 Qwen2.5-7B-Instruct协同策略的其余部分没有被学习系统上限受这些静态模块的能力约束。奖励与裁判依赖奖励是 GPT-4o LLM-as-judge 给出的 ${0,1}$ 二元信号稀疏且强依赖外部裁判换成自建裁判会引入新的偏差源。规模与预算有限主干只验证了 3B 与 7B训练用 8 张 A100、rollout 轮数上限为 3评测轮预算封顶 $T_{\text{max}} 10$更长horizon没有测试。工具与场景固定五个工具都是文本与代码类未涉及多模态、代码库级或真实网页交互等更开放的设定。论文自身的结构缺口叙事与措辞分析附录正文中an on-policy, outcome-driven algorithm thathatconverts multi-turn RL多出一个 hat 的拼写错误摘要中even surpassing larger proprietary models like GPT-4o这类强声明没有附显著性检验全文定义了 limitation 环境却没有独立的局限性章节也没有列出负面结果。常见问题FAQAgentFlow 与 Search-R1、ToRL 这类工具集成 RL 有什么本质区别Search-R1 与 ToRL 训练的是单一而庞大的策略把思考与工具调用交错在同一条完整上下文里AgentFlow 则把工作分解到四个专用模块只训练规划器并让它在真实多轮循环内部做 on-policy 优化。因此 AgentFlow 的规划器能吸收工具报错、验证器信号与记忆更新的真实分布而单体策略只能在完整上下文里一次性推理。Flow-GRPO 为什么把同一条轨迹的所有轮次给同一个奖励因为中间动作对最终解的贡献是间接的且价值可能在多轮之后才显现。用脆弱的中间启发式分配信用会引入噪声论文改为把轨迹级最终结果奖励 $r \bar{R}(o, q, y^) \in {0,1}$ 广播到每一轮再用组归一化优势降低方差。这一设计的合法性由附录中的等价性证明*保证最大化多轮全局目标等价于最大化期望的 token 级单轮目标。为什么离线监督微调SFT会崩溃 19 个百分点SFT 是 token 级的模仿目标与轨迹级的任务成败并不对齐它无法让规划器适应动态的工具反馈也无法从复合误差中恢复。消融显示把 GPT-4o 行为蒸馏成 SFT 后平均准确率从 38.5 掉到 19.5−19.0而同样数据下的在流 RL 拿到 55.717.2。AgentFlow 用的是多大的模型需要多少算力主实验四个模块与工具都用 Qwen2.5-7B-Instruct规划器用 Qwen2.5-7B 训练训练在 8 张 NVIDIA A100 上完成rollout 轮数上限为 3学习率 $1\times10^{-6}$。缩放实验额外验证了 3B 与 7B 两个规模两者都从 Flow-GRPO 获得一致增益。这套方法对实际部署最直接的价值是什么两点。第一不需要为了某一类任务重训整个系统任务差异由规划器的工具选择策略自动吸收例如 MedQA 从通用搜索转向 Wikipedia 与文档内检索第二底层工具或主干升级可以被即时吸收把工具换成 GPT-4o 版本后 HotpotQA 还能再涨 13.0 个百分点说明规划器学到的是可迁移的调度能力而不是对特定工具的过拟合。论文有没有明显的不足有。它只训练规划器其余三个模块全程冻结奖励依赖 GPT-4o 裁判主干规模只到 7B、评测轮预算封顶 10工具与任务也局限于文本与代码场景。此外论文定义了 limitation 环境却没有独立的局限性章节正文还残留一处拼写错误与一处未附显著性检验的强声明。参考链接AgentFlow 论文arXiv:2510.05592——In-the-Flow Agentic System Optimization for Effective Planning and Tool Use, ICLR 2026AgentFlow 项目网站——论文主页、可视化与 DemoAgentFlow 开源代码lupantech/AgentFlow——四模块实现与 Flow-GRPO 训练代码GRPO / DeepSeekMath——Flow-GRPO 的组相对优势与裁剪目标出发点Search-R1——搜索增强的结果奖励 RL 基线ToRL: Scaling Tool-Integrated RL——代码增强的工具集成 RL 基线AutoGen——同主干、训练-free 的多智能体框架基线GAIA 基准——通用智能体能力评测协议给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件