华为:长周期科研智能体ScienceFlow

发布时间:2026/8/26 17:20:01
华为:长周期科研智能体ScienceFlow 标题ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond来源arXiv, 2608.14354v1️文章简介研究问题如何让大语言模型智能体在机器学习与科学发现等长周期任务中维持稳定、高效且目标一致的研究进程克服状态丢失、死胡同无法恢复及计算资源浪费的问题主要贡献论文提出了ScienceFlow框架通过可恢复的执行工作空间、基于重锚定的状态转换机制ESTRA及证据感知的执行控制实现了跨领域长周期自主科研的高效探索在MLE-bench上取得SOTA成绩。重点思路构建可恢复的执行工作空间将研究进度表示为包含代码、数据、模型权重及验证证据的可执行状态快照而非简单的文本日志确保研究过程可随时中断、恢复或回溯。引入ESTRA状态转换机制在研究片段边界触发“通过重锚定进行可执行状态转换”ESTRA智能体根据现有证据和剩余预算选择从当前状态继续或从归档的历史状态重新锚定以决定是延伸当前路径还是 redirect 到新分支。实施证据感知的执行控制分离科研路线选择与物理执行管理。执行控制器依据资源可用性、剩余预算及已验证的进展证据动态决定任务的准入、监控、暂停或终止避免在低价值或停滞的任务上浪费算力。设计持久化记忆与上下文组装通过Add、Fold和Unfold操作管理长期记忆既保留完整的研究历史档案又在每个研究片段提供紧凑且相关的上下文视图支持智能体在有限上下文窗口内进行有效的重锚定决策。分析总结在MLE-bench基准测试中ScienceFlow在24小时预算下取得了70.22%的Any-Medal率超越最强基线4.92个百分点尤其在中等难度任务上优势显著证明了其在复杂工程任务中的有效性。消融实验表明移除ESTRA机制会导致获取奖牌的时间显著延迟而移除执行控制则会在长耗时任务中导致效率大幅下降两者共同作用提升了最终成功率与资源利用效率。在数学优化与科学建模任务中ScienceFlow同样表现优异如在KTTSP硬轨道排名第三并在SciModelingBench上获得最佳组平衡分数验证了该框架在不同可执行科研任务间的通用性与迁移能力。案例研究显示智能体能有效利用状态恢复功能从失败的CNN探索中回退并复用特征转向树模型通过选择性重用过往工件减少了重复计算体现了长周期记忆与状态管理的实际价值。个人观点论文将“可执行状态”作为长周期科研的基本单元解决了传统Agent仅依赖文本记忆导致的上下文溢出与状态不可复现痛点。