
标题On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification来源arXiv, 2608.18066v1️文章简介研究问题基于记忆的自改进智能体在复杂环境中的可靠性与稳定性究竟如何主要贡献通过多轮运行和随机任务顺序评估揭示了现有自改进方法的高方差及对任务顺序的过度依赖并指出规范缺失是导致脆弱性的关键原因。重点思路扩展评估维度对两种代表性记忆基方法AWM和RBank进行重新评估引入多次独立运行以量化方差并打乱任务顺序以测试鲁棒性打破以往单次运行和固定顺序的局限。分析方差来源对比无记忆基线与自改进方法发现自改进机制会放大初始随机性导致不同运行间性能差异显著增大最佳与最差运行差距可达10个百分点。检验任务顺序影响发现默认任务顺序隐含了由易到难的课程学习效应是先前方法成功的关键隐藏前提一旦任务顺序随机化智能体性能不升反降。探究根本原因通过人工检查记忆内容提出环境与任务规范不足Underspecification假说即智能体因缺乏明确约束而生成了看似合理但不可执行或无关的记忆。验证缓解措施在记忆构建中引入详细评分标准、环境反馈及明确的提示词修改以增强规范性观察其对性能下降的修复效果。分析总结自改进加剧噪声在71%的案例中应用自改进方法后方差增加证明该方法在复杂环境中不仅未能稳定提升反而放大了评估噪声。顺序依赖严重在随机任务顺序下智能体平均性能下降4.5%而在默认顺序下仅提升1.5%表明其不具备真正的在线适应能力严重依赖隐式课程。规范缺失致错智能体常生成如“调用API”或“请求人工确认”等在当前浏览器环境中无法执行的建议或因任务歧义产生错误推理这些错误记忆会污染后续任务。部分缓解有效引入额外规范信息能收回31%的性能损失但仍有显著差距说明存在其他未明因素完全解决脆弱性仍需进一步研究。个人观点论文从“能力评估”转向“可靠性压力测试”指出了当前自改进智能体研究中存在的评估偏差。它揭示了记忆机制并非万能若缺乏严格的环境与任务规范记忆反而成为错误传播的载体。