长时程智体的综述:基础、演化、驾驭、优化、应用和前沿(下)

发布时间:2026/8/10 2:44:48
长时程智体的综述:基础、演化、驾驭、优化、应用和前沿(下) 26年7月来自人大、北大、清华、中山大学、港科大和新加坡国立的论文“Towards Long-Horizon Agents: A Survey, Foundation, Evolution, Harness, Optimization, Application, and Frontier”。随着LLM能力的快速发展人们对人工智能智体的期望正从解决简单的单回合任务转向在现实世界中执行长时程任务。这类系统称为长时程智体它们能够进行长时程规划与现实世界环境互动从自身错误中恢复并在执行过程中调整策略。这种能力正迅速成为实用智体智能的核心瓶颈。尽管取得了这些进展但该领域仍然缺乏对长时程智体的统一定义和分类。诸如“自演化”或“自主”智体等相关概念经常被互换使用但这些概念都未能清晰地阐明构建长时程智体的真正含义。这种认知上的缺失使得业界缺乏一种系统性的方法来评估长时程能力的进步。本文通过将长时程智体视为外部驾驭harness和内部优化的协同演化构建了一个统一的框架并围绕六个相互关联的视角展开论述基础、演化、驾驭harness、优化、应用和前沿。首先将长时程智体形式化为一种与工具耦合的决策过程并将其与诸如长时间运行执行、自主性和自我演化等邻近概念区分开来。然后追溯该领域从提示prompt级控制到运行时智体系统的演进历程并从外部化驾驭和内部化优化这两个互补视角对现有工作进行分类。在此基础上根据接口将长时程智体分为五种应用形式并回顾相应的基准测试和资源。最后讨论了关键挑战和前沿方向。。。。继续。。。优化就是如何将这些能力逐步内化到模型参数中。按照训练流程组织本节内容。首先是架构基础它首先决定了长时域训练和推理在计算上是否可行无法表示和高效处理长轨迹的策略无法有效地进行长轨迹训练。然后考察能力发展的六个阶段数据和环境合成、预训练和中期训练、微调、强化学习、策略内蒸馏和自进化。图 11 概述整个流程表 5 总结每个阶段的特征、机制和代表性工作。架构基础及其六个训练阶段如下架构基础使长轨迹的训练和解码更加高效。数据和环境合成构建可验证的长期经验包括任务、环境和轨迹供后续阶段用于训练和反馈。训练前/中期构建动作-观察和推理先验使智能体的行为自然而然而非被动接受。微调从精心设计的智能体轨迹中培养行为和工具使用规范。强化学习优化整个轨迹并在稀疏、延迟奖励下解决长期信用分配问题。策略内提炼将策略巩固到自身的状态分布上减少分布偏移并稳定先前学习的行为。自我演化将自我生成的经验、反馈和任务环境更新转化为持续的策略改进。与监督式微调相比智体强化学习Agentic RL进一步利用智体自身交互的反馈来优化策略。这使得LLM的优化目标从单轮响应扩展到长时程交互轨迹。如图12所示其核心挑战涉及四个方面采样信息丰富的多轮轨迹、从稀疏反馈中提取多粒度信用信号、将这些信号整合到稳定的策略更新中以及组织训练交互模式例如层级结构、工具使用、多智体协作和记忆。表6列出各部分的代表性工作。自进化作为一种​​训练机制用于内化智体自身产生的经验。前几个阶段主要依赖于预先准备好的数据、任务集、环境集合或轨迹。自进化增加一个反馈回路当前策略会在其环境中产生新的尝试、失败和反馈而训练过程会将选定的记录写回模型。这正是它与上述两个蒸馏阶段的区别所在微调蒸馏和策略内蒸馏都使用在训练轮次中保持不变的监督源而自我进化则将数据、任务甚至环境视为循环自身更新的对象。近年来这已发展成为一个快速发展的研究领域已有专门的论文详细阐述了智体如何自主地进化其模型、记忆、工具和工作流程以实现终身适应 [147, 165]。如图 13 所示这项工作分为三种形式离线自进化、在线自进化和智体-环境协同进化。长时程智体运行于各种各样的环境中从代码库和网页文档到图形界面、多模态流以及开放式的研究工作流程。这些场景不仅在任务持续时间上有所不同而且在智体观察、行动和接收来自外部世界的反馈的界面上也存在差异。这反过来又决定了执行过程中可用的信息、可以本地检测的错误以及智体必须添加哪些能力来弥补环境的不足。图 14 将代表性应用分为五大类各类应用的区别在于每个智体观察和行动的界面长时域智能体的五大代表性应用包括软件工程智体在代码库和执行环境中进行操作通常可以通过测试、编译器和运行时输出来检查编辑内容。信息检索智体与 Web 文档、搜索引擎和知识库交互其挑战在于如何在没有直接执行预言机的情况下收集和综合证据。计算机使用智体通过屏幕截图、辅助功能树和底层操作来操作图形界面推断和操纵部分可观察的界面状态。多模态智体对长时间的视觉、听觉和文本流进行推理其中相关信息分布在不同的时间和模态中。通用智体将多个此类接口组合在一个工作流中利用异构工具、权限和外部服务。长时程智体的进展是通过共享的基准测试和开放资源基础来衡量和复现的。由于报告的分数反映了模型、框架和训练方案的共同贡献因此长时程评估最好被理解为具有时程-觉察能力对目标必须保持的时间长短敏感和归因-觉察能力能够区分框架引起的差异和模型引起的差异[123, 286, 468]。用作基准测试的可验证的长时程环境也经常被重用作优化方法的训练环境因此评估进展和内部化进展紧密相关。除了下表列出的域基准测试之外越来越多的测试套件特意强调多小时的自主性。例如从 MLE-bench [51] 中的机器学习工程到 PaperBench [560] 中对研究论文的端到端复现这些都补充 METR [286, 429] 的前沿时间范围测量。总而言之这些资源表明长时评估正围绕有状态、耗时数小时且经济效益显著的任务进行整合并且报告的分数必须被解读为模型、框架和训练方案的共同属性而不仅仅是模型本身的属性。本文预期将定义未来几年研究方向的最具影响力的范式转变以及每种转变所蕴含的未解难题。最重要的前沿领域存在于这一过渡空间能力在框架和权重之间双向迁移。驾驭harness本身也从固定的脚手架转变为可学习、可移植的对象。在嘈杂、高成本的真实环境中长时程行动力会打破两个支柱所依赖的理想化前提。核心诊断是实际的长时程进展越来越取决于模型运行环境的属性而不仅仅是模型本身。为了便于比较这些压力将前沿领域归纳为四个更高层次的维度演化、有效性、效率和可信度。表 8 概述此结构下的九个立场。对于每个具体的前沿领域首先说明该领域所处的现状和阻碍因素现状和挑战然后说明对该领域未来发展方向的立场以及它所遗留的未解决问题展望。