让AI自己动手改造自己的“作战工装“,会发生什么?

发布时间:2026/9/1 22:41:21
让AI自己动手改造自己的“作战工装“,会发生什么? 你有没有想过这样一件事现在市面上那些能写代码、能玩游戏、能完成复杂任务的AI智能体它们的大脑也就是那个语言模型本身其实一直没变变的是什么变的是穿在大脑外面的那层衣服。这层衣服有个专业名字叫做harness**harness智能体执行框架/harness**包裹在语言模型外面的一整套可执行脚手架包括提示词、工具调用逻辑、记忆管理、验证机制等负责把模型的想法转化成能在真实环境里执行的动作。你可以把语言模型想象成一个非常聪明但没有手脚的大脑而harness就是给这个大脑装上的四肢、工具箱和操作手册。同一个大脑穿上不同的工装干活的效率能差出一大截。这不是夸张后面你会看到同一个模型光是换个harness成绩能从18.9分跳到41.4分翻了一倍还多。问题来了现在市面上大部分做法是工程师手动去调这套工装。模型升级了工装往往还是老样子被当成一次性用完就搁在那里的固定资产。有没有可能让AI自己去改造这套工装越用越顺手这正是这篇来自香港科技大学的论文要回答的问题。作者提出了一个叫做**HSIHierarchical Self-Improvement分层自我改进**的框架让一个参数完全冻结、不做任何训练更新的语言模型通过不断重写自己的harness来实现性能提升。这件事到底难在哪在讲HSI具体怎么做之前得先说清楚这条路上已经有谁在走走到哪儿卡住了。第一条路叫做**Godel式自我改进Godel-style self-improvement****Godel Machine哥德尔机**2003年由Jürgen Schmidhuber提出的理论构想指一个能够修改自己程序包括修改未来修改机制本身的系统前提是每次修改都能被证明会带来性能提升。这个想法后来被一批工作实现成了真实系统比如Darwin Godel MachineDGM、Huxley-Godel MachineHGM等等。它们让AI去改自己的决策代码取得了不错的效果比如DGM在SWE-bench编程测试上把成绩从20%提到了50%。但这些工作动的是模型每一步怎么想的决策逻辑而不是整个执行框架。第二条路叫做**harness工程harness engineering**这条路上的代表作是Meta-Harness它把harness优化当成一个外层搜索问题让一个更强的设计师模型比如Claude Opus这种顶级模型去帮一个较弱的模型优化工装。效果确实好但问题也很明显你永远需要一个更强的外部大脑来帮你改造这不算真正的自己动手。第三个问题更麻烦**大家发现很多号称AI自我进化的成果可能只是测试时算力堆出来的假象**有一篇批判性研究Wang et al., 2026b做了严格对照实验发现如果不控制反馈预算harness进化的效果甚至不如简单地让模型多试几次、多采样几遍。换句话说很多进化其实是多花钱多试伪装出来的进步一旦挪到没见过的新任务上提升幅度只有0.6个百分点几乎等于没进步。这就像一个学生考前疯狂刷了一套题的原题考试成绩确实高了但换一套新题立刻现原形这不叫学会了叫背答案。所以真正的难题是能不能让一个冻结的模型靠自己的力量真正学会改造自己的作战工装而且这种改造是能迁移到没见过的新任务上的不是死记硬背HSI是怎么设计的三层套娃结构HSI的核心想法可以用一句话概括把干活的和改造干活方式的分成不同的层级层层嵌套但最外层永远锁死不动。具体来说同一个冻结的语言模型M在三个不同的层级上工作。**任务harness层Task Harness H**直接执行任务的那套工装包含提示词、工具、记忆管理等是与环境实际打交道的那一层。**进化器层Evolver**负责重写任务harness H的那套策略它会选种子、生成候选修改方案、挑选提交版本。**元进化器层Meta-Evolver**比进化器还高一层它负责修改进化器怎么进化这套策略本身但它自己的执行逻辑是写死的不能再往上改。为什么要设计成这样三层而不是让模型直接无限制地改自己这里就要说到一个很现实的顾虑**无限制的自我修改是危险的**想象一个员工被授权可以修改公司所有规章制度包括修改谁有权修改规章制度这条规则本身。如果没有任何边界这个员工理论上可以把自己变成不受任何约束的独裁者公司彻底失控。HSI的解法是设一道防火墙员工进化器可以改具体的工作流程任务harness上级元进化器可以改员工的工作方法论但公司的宪法元进化器自己的执行逻辑是刻在石头上的谁都动不了。这就是论文里说的frozen outer anchor冻结的外层锚点。如果没有这道锚点自我修改就可能陷入无限递归的失控状态你永远不知道系统下一步会把自己改成什么样子。三层结构定下来之后整个进化流程被拆成五个阶段一圈一圈循环。第一阶段是**种子选择Seed Selection**系统会维护一张不断累积的进化图谱图上每个节点是一个提交过的harness历史版本标注着它拿到的奖励分数。种子选择这一步就是从这张图里挑一个祖先版本围绕它生成一个结构化的假设包括为什么选它、期望往哪个方向改进、以及一个可以验证对错的标准。这一步的巧妙之处在于它把进化从瞎改乱试变成了带着假设去验证。你可以类比成一个科学家做实验不是随便调参数看运气而是先说清楚我猜提高这个参数会让反应更快如果实验结果没变快说明我这个假设是错的。如果没有这个假设生成的步骤进化过程很容易陷入盲目试错浪费大量计算资源在没有方向感的修改上。第二阶段是**主进化Main Evolution**这一步就是真刀真枪去改代码了。模型会读取、编辑harness里的提示词、工具、内存管理等各个组件生成若干个候选版本。这里有一条铁律必须守住叫做**任务注入接口task-injection interface**不管harness内部怎么改它和外部任务对接的那个接口必须保持不变。这就好比换手机壳不管壳子的花纹、材质怎么变手机壳和手机之间的卡扣尺寸必须固定否则壳子和手机装不到一起去了。有了这个固定接口不同版本之间才能被公平地放在同一条起跑线上比较进化版本才能做到热插拔随用随换。第三阶段是**提交选择Commit Selection**这里有个反直觉的设计系统不是只留下分数最高的那一个候选而是刻意保留一个多样化的提交池把好几个不同方向的尝试都存下来哪怕它们暂时分数不是最高的。原因很简单如果只认死理只留最优解一旦这个方向后期走进死胡同系统就没有回头路可走了。这跟投资组合分散风险是一个道理你不会把所有钱压在一支股票上哪怕它现在涨得最猛因为你不知道明天它会不会跌。第四阶段是**元进化Meta-Evolution**这是HSI真正区别于以往工作的地方。前三步一直在改的是具体怎么打这场仗元进化改的是怎么打仗的方法论。比如进化器学到一条经验优先暴露隐藏的游戏反馈信号比盲目改提示词更有效这条经验会被写进策略里成为后面所有轮次都能继承的公共知识而不是每次进化都从零开始摸索。第五阶段是**最终版本选择Best-Version Selection**前面几轮进化追求的是多样性和探索最后这一步反过来专门挑泛化能力最强、在验证集上表现最稳的那个版本导出去做真正的部署评测。实验怎么验证这套体系真的有用光有设计思路不够得看真刀真枪的实验数据。研究者选择了一个叫做**BALROG**的基准测试平台。**BALROG**一套专门用来测试AI智能体在长周期文字交互游戏中表现的基准测试集包含BabyAI、BabaIsAI、Crafter、TextWorld、MiniHack、NLE六个环境难度呈现一个由易到难的自然梯度能测试规划、记忆、探索、工具使用等多种能力。为什么选这个平台做实验场因为它天然覆盖了不同难度的任务而且这些任务需要智能体持续维持状态、执行多步骤推理、通过和环境交互获得反馈来调整行为。这就像考驾照科目一是笔试送分题科目三是路考真本事如果只在笔试上测你永远不知道这个人到底能不能真正上路开车。BALROG提供了从送分题到高难度路考的全谱系可以清楚看出harness进化到底在哪个难度区间是有效的、又是在哪个区间失效的。实验用的骨干模型是DeepSeek-V4-Flash全程冻结参数不动。这里有个很讲究的设计叫做**thinking-on/off推理开关切换**设计在真正执行任务的时候系统关闭模型的深度推理能力只在做harness自我修改的时候打开推理。为什么要这么反着来设计因为如果任务执行时也开着推理你没办法判断最后的性能提升到底是harness改得好还是仅仅因为模型这次多想了几步。这个设计其实是在做一个严格的对照实验把多花算力多想这个变量死死摁住只让harness的结构变化来决定成绩差异。这就好比测试一辆车换了新轮胎之后跑得快不快你必须保证发动机功率不能中途偷偷加大否则你测出来的提速到底是轮胎的功劳还是发动机的功劳根本说不清楚。实验结果表格如下重点数字用加粗标出| 模型 | BabyAI | Crafter | TextWorld | MiniHack | NLE | 平均 ||---|---|---|---|---|---|---|| DS-V4-Flash初始harness | 42.0 | 11.6 | 40.0 | 0.8 | 0.0 | 18.9 || DS-V4-Flash HSI元进化关闭 | 77.3 | 36.4 | 46.0 | 5.8 | 0.0 | 33.1 || **DS-V4-Flash HSI元进化开启** | **81.3** | **44.6** | **65.0** | **15.8** | 0.2 | **41.4** |数字背后是什么意思BabyAI这个环境初始harness只能拿42分经过HSI进化之后冲到81.3分接近翻倍。Crafter从11.6分涨到44.6分涨了近4倍。TextWorld从40分涨到65分这个成绩甚至超过了Grok-462.9分和Claude-Opus-4.5-Thinking59.0分这些顶级商用模型在原生配置下的表现。请注意参与对比的这些顶级模型是在自己完整的推理能力、原生配置下跑出来的成绩而HSI这边的骨干模型是一个在执行阶段被关闭了深度推理的降智版本。一个被削弱了推理能力的模型光靠改造外面的工装居然能追上甚至反超那些开着全部推理能力的顶级模型这说明harness这层衣服对最终表现的影响被严重低估了。但NLE这一行的数字很扎眼无论怎么进化成绩都停留在0到0.2分几乎纹丝不动。这是本文最重要的发现之一后面会专门展开讲。元进化到底有没有用拆开看前面表格里那两行元进化关闭和元进化开启的对比其实是一次专门为了检验元进化器价值而做的消融实验。去掉元进化器之后各项成绩都在下滑BabyAI从81.3掉到77.3Crafter从44.6掉到36.4TextWorld从65.0掉到46.0掉了整整19分MiniHack从15.8掉到5.8掉了10分。有意思的是掉幅的分布规律**TextWorld和MiniHack这两个harness搜索空间更复杂的任务掉幅最大**这说明了一件事当问题简单的时候随便试试就能碰上不错的解法元进化器锦上添花的作用有限但当问题变复杂、搜索空间变大的时候学会怎么更好地去搜索这件事本身的价值就凸显出来了。这就像下棋简单的残局你随便走两步可能就赢了但复杂的中盘搏杀光靠临场直觉不够你需要一套成体系的战术思维来指导每一步棋该往哪个方向想这套战术思维就相当于元进化器学到的东西。更硬核的考验换到没见过的新题上还行不行前面说的都是同一批题型里抽到不同的具体题目能不能考好这属于比较宽松的测试。真正严格的测试是完全没见过的新题型能不能靠已经学到的解题思路蒙对。论文设计了第二套评测协议专门在BabaIsAI这个子任务集合上做**held-out留出测试**具体做法是把BreakStop、GoTo、Make这几个任务家族各自切出20%的任务藏起来进化过程全程看不到这部分数据只用剩下80%去训练harness最后拿藏起来的这20%去检验真本事。结果表格如下| 子任务 | 初始harness | 开发集最佳 | 测试集最佳元进化开 | 测试集最佳元进化关 ||---|---|---|---|---|| BreakStop | 0.033 | 1.000 | **0.980** | 1.000 || GoTo | 0.182 | 1.000 | **1.000** | 0.964 || Make | 0.000 | 0.556 | 0.363 | 0.338 |BreakStop和GoTo这两个偏向导航类的任务测试集成绩几乎和开发集打平说明harness里学到的东西是真本事不是死记硬背。而Make这个涉及多步骤合成制造的任务成绩明显掉了一截只有0.36左右。这个对比暴露出一个很朴素但很重要的规律**导航这类相对结构化、规则清晰的任务学到的技巧容易被总结成通用规则能迁移而多步骤制造这种需要长链条规划的复杂任务学到的技巧更容易和具体场景绑死迁移能力就弱一些。**这就好比学开车和学做菜的区别。学会了怎么在小区里倒车入库换到另一个陌生小区的车位大概率还是能停进去因为倒车这件事的核心规律打方向盘的时机、后视镜观察角度是普适的。但学会了做一道特定的菜换一种没做过的食材很多细节判断火候、下料顺序就没法直接套用了因为这道菜的经验里混杂了太多针对这种食材才有效的具体窍门。那道过不去的坎NLE到底怎么回事前面提到NLE环境上harness进化几乎完全没起作用得分一直在0附近打转。这不是bug这是这篇论文最诚实也最有价值的一个发现。论文里给出的解释是两条**边界bound****反馈保真度边界feedback-fidelity bound**进化这件事本质上是一个不断试错、根据反馈调整方向的过程如果环境给出的反馈信号本身就极其稀疏、模糊、没什么区分度进化就没有可以依靠的信号来判断哪个方向是对的。**骨干能力边界backbone capability bound**不管你怎么给模型换外面的工装模型本身的推理能力上限摆在那里工装再怎么优化也没法让一个想不明白复杂决策的大脑突然想明白。NLE这个环境本身就是一个极其复杂的roguelike游戏状态空间庞大反馈稀疏连初始harness下模型的表现都接近0分。这时候不管怎么改harness模型都没法从环境里获得有意义的成功经验去总结规律自然也就无从进化。这就像给一个完全不识字的人配一套最先进的读书笔记软件不管这套软件的排版、检索、标注功能做得多么精妙这个人依然读不懂书里写的是什么。工具再好也弥补不了识字这个前置能力的缺失。这也是为什么这篇论文反复强调harness进化的价值是放大和重组已有能力而不是无中生有创造能力。**如果不承认这个边界会让人误以为自我改进可以无限逼近完美但实验数据明确告诉我们事情不是这样的。**顺带一提这个发现和另一篇独立研究Lin et al., 2026b《Harness Updating Is Not Harness Benefit》的结论高度吻合。那篇研究发现harness的更新能力和从更新中获益的能力其实是两回事中等水平的模型从harness优化里获益最大提升可达19.3个百分点而能力特别弱的模型反而获益最小因为它连按照新harness里的指导去执行这件事本身都做不好。这不是巧合两篇论文各自独立地摸到了同一堵墙。进化过程里到底发生了什么看两个真实轨迹论文里放了两张进化轨迹图一张是Crafter这种同分布进化的例子一张是BabaIsAI-Make这种留出集进化的例子读起来很有画面感。Crafter那张图显示第一轮进化主要是把游戏里原本藏起来的信息暴露出来比如把隐藏的奖励信号、库存状态结构化地摆到模型面前。这一步带来了单轮最大的一次跳跃开发集奖励从0.166直接跳到0.430涨幅接近2.6倍。到了第三、四轮进化方向变得更精细开始尝试规则建议和安全约束这类更专门化的机制第四轮达到最高点0.578成为最终导出的最佳版本。但第五轮出现了回退说明进化不是单调向上的而是在一个非凸的设计空间里来回摸索有的分支走对了有的分支走岔了。BabaIsAI-Make那张图更有意思开发集奖励从0.222一路涨到0.556途中经历了单步执行改成计划追踪、构建空间地图、加入BFS路径规划算法、加入自动推动机制、最后加入跨房间导航能力这五个阶段。这里最值得一提的是元进化器把LLM负责定目标BFS负责导航这条模式总结了下来写进了策略里让后续的迭代能直接继承这个分工思路而不需要每次都重新摸索。这个细节其实很耐人寻味**模型自己发现让语言模型去做它擅长的高层判断把具体的路径搜索这种确定性计算任务交给传统算法BFS广度优先搜索效率比让语言模型逐字逐句推理每一步路径要高得多。**这个发现本身没有被人明确教给模型是它在不断试错的过程中自己摸索出来的分工方式。这有点像一个刚上任的项目经理一开始事事亲力亲为后来慢慢发现有些机械性、规则明确的活儿丢给专门的工具去做更靠谱自己应该把精力放在拿主意、定方向上这种角色认知的转变往往是团队效率突然提升的转折点。这篇论文站在谁的肩膀上又指向了哪里这项工作并非凭空出现它站在两条已经走了一段路的研究脉络的交汇点上。在Godel式自我改进这条线上2003年Schmidhuber提出的Godel Machine理论构想到了2025到2026年被一批工作真正实现出来比如2026年的Darwin Godel Machine把自我修改的对象扩展到整个代码库用一套基于归档的开放式探索机制把编程测试成绩从20%提升到50%同年的Huxley-Godel Machine则解决了一个更细的问题就是怎么判断一个中间版本到底有没有继续进化下去的潜力而不只是看它当前分数高不高。在harness工程这条线上2026年的Meta-Harness第一次把harness优化当作一个可以严格搜索的问题来做但它依赖一个更强的外部模型来当设计师同年的Self-Harness则往前迈了一步让模型自己给自己改harness不需要借助外部更强模型的帮助。HSI的位置正好卡在这两条路的交界处它既不像Godel系工作那样只改模型的决策代码把范围局限在小圈子里也不像Meta-Harness那样依赖外部更强模型而是让同一个冻结的模型横跨执行、进化、元进化三个层级去自己改自己还专门设计了留出集测试来验证这不是在作弊。写在后面读完这篇论文最触动我的其实不是那些分数上涨的曲线而是NLE那一行怎么改都是0的数字。很多讲AI自我进化的文章都倾向于渲染一种越进化越强、无所不能的叙事但这篇论文很诚实地把那道墙摆出来了反馈信号不够好或者模型本身能力不到位harness再怎么折腾也没用。这种承认边界的态度反而比一味鼓吹突破更让人信服。另一个值得琢磨的细节是那个BFS路径规划的自发涌现。模型在没人明确教它复杂计算交给传统算法这条原则的情况下自己在试错里摸出了这套分工方式。这让我想到也许所谓的智能进化很多时候不是学会了什么全新的知识而是学会了什么时候该用什么工具包括什么时候该承认自己不擅长、该把活儿交出去。这种元层面的判断力可能比具体某个技巧本身更值钱。如果harness的进化真的只能在骨干模型能力范围内打转那未来会不会出现一种局面不同任务家族各自养着一套专属的进化harness而真正决定天花板的始终是那个被冻结着不动的大脑QAQ1HSI框架是什么AHSIHierarchical Self-Improvement分层自我改进是一个让冻结不变的语言模型自己重写执行框架harness来提升性能的框架包含任务harness层、进化器层、元进化器层三层结构最外层执行逻辑始终锁死不变。Q2HSI在哪些任务上效果最好哪些任务上没效果A在BabyAI、Crafter、TextWorld这类中等难度任务上提升明显比如BabyAI从42分涨到81.3分但在NLE这种反馈极稀疏、任务极复杂的环境里几乎没有提升说明harness进化受限于反馈质量和模型自身能力上限。Q3HSI进化出来的harness能不能用到没见过的新任务上A在BabaIsAI的BreakStop和GoTo这类导航型任务上留出测试集成绩接近满分说明学到的是可迁移的通用技巧但在Make这种多步骤合成任务上迁移效果明显较弱只有0.36左右。