
Jakub Pachocki 这个名字这两年只要你在关注 AI 前沿就不可能没听过。作为 OpenAI 的首席科学家他说出来的话往往比 CEO 的公开演讲更硬核更贴近技术底层。最近他抛出的一个判断在圈子里炸开了锅进展速度可能延续至递归自我改进。什么意思简单说就是 AI 的进化速度本身可能很快就不再主要靠人类给它“喂招”了而是开始进入一个自己加速自己、自己改进自己的阶段。这个消息在技术圈、创投圈、甚至普通网友那里都引起了巨大的争论。我第一眼看到这个判断时第一反应不是兴奋而是一股很强的凉意从后背升起来——因为如果这个判断成真我们面对的就不仅仅是一个更聪明的工具而是一个有自我进化潜力的智能体。作为一个长期关注大模型演进、每天都在用各类 AI 工具写代码、做分析的人我觉得这个话题值得拆开揉碎了好好聊聊。这篇文章不站台、不吹捧纯粹从一个技术关注者的角度去拆解一下递归自我改进到底是什么Jakub Pachocki 的判断依据可能是什么以及这个判断如果真的应验会带来哪些连锁反应。1. 递归自我改进让 AI 成为自己的工程师1.1 先别被名词唬住用大白话拆解这个概念很多朋友一看到递归自我改进这种词第一反应就是这是不是科幻片里天网觉醒的前兆。其实完全没有那么玄乎用最朴素的语言来解释这讲的是一个系统能否通过修改自己的运行逻辑、训练数据甚至是底层架构来让自己变得更强。类比一下就很好懂了。你是一个刚入职的初级工程师你的组长每天教你怎么写代码、怎么调 Bug。你成长很快但天花板取决于组长的水平和你自己的学习速度。但突然有一天你写出了一个自动化测试助手它不仅能帮你找 Bug还能根据你过去的代码风格自动帮你重构代码、优化性能甚至自己设计新的测试用例。于是你的开发效率瞬间拉满一周能顶过去一个月。再往后你教这个助手学习你最新的设计思路它反手就帮你把整个项目的架构图重画了一遍还指出了几处潜在的内存泄漏隐患。递归自我改进就是让 AI 站在自己肩膀上去够更高的高度。它不再只是被研发的对象而是研发的主体之一。放在大模型语境下就是让 GPT-6 帮我们更高效地训练出 GPT-7让 GPT-7 再帮我们搞定 GPT-8。这个循环一旦启动每个阶段的提升速度就不再是线性累加而是指数级起飞。1.2 Jakub Pachocki 是什么人他的话为什么值得重视聊到这个判断的分量就不能不提说话的人。Jakub Pachocki 不是普通的嘴上跑火车的技术网红他是 OpenAI 算法和训练侧的绝对核心。GPT-4 的许多关键技术决策背后都有他的影子。早年他主导了 Dota 2 的 OpenAI Five 项目这个项目不仅在游戏里打赢了世界冠军级选手还积累了大量关于大规模强化学习、稀疏奖励环境下训练的经验。这层背景很重要。因为你要知道一个天天做强化学习、做大规模分布式训练的人他对进展速度的感知来自实打实的算力消耗曲线和模型能力曲线而不是靠拍脑袋想象。他说预期进展速度可能延续说明在他的视角里训练下一代模型所需的有效数据供给、算法效率、以及人力研发成本正在以一种非常微妙的方式被 AI 自身反哺。换句话说他看到了真实的数据AI 辅助下研究团队的代码产出量在飙升实验迭代周期在缩短连论文阅读总结的速度都提到了一个不可思议的量级。这些变化叠加起来指向一个结论——人类参与 AI 研发的边际成本在降低AI 参与 AI 研发的比例在上升。2. 为什么 Jakub Pachocki 认为速度会延续三个底层逻辑2.1 逻辑一AI 让研究者变成了超级个体不知道大家有没有这种感觉最近半年很多独立开发者或者三五人的小团队做出来的产品功能比以前一个二十人团队还丰富。这背后不是人的能力突飞猛进而是 AI 把每个人的人均产出拉高了好几倍。我自己就有切身体会。以前写一个完整的后端服务从搭框架到写接口文档少说也得三五天。现在我习惯让 AI 先出第一版代码我负责审代码、提修改意见、跑测试和修边缘情况。同样的功能基本一天就能出活而且代码风格比我手敲的还规整。在 OpenAI 内部这种模式只会更极致。他们的研究团队用 Codex 来处理大量工程重复劳动用模型辅助写新的训练脚本用强化学习自动搜索超参数。当每个人都变成能调用大量 AI 工具的超级个体时整个团队的研发速度就不再受限于人写代码的速度而是受限于人对问题的定义能力和决策速度。而这两个瓶颈恰恰也是 AI 最擅长辅助的部分。2.2 逻辑二数据与算法效率的提升打破了数据墙的魔咒前两年一直有个论调说大模型训练已经撞上了数据墙互联网上的高质量文本数据快被薅完了后面模型迭代会大幅放缓。这个观点在 GPT-3 时代是成立的但在 GPT-4 之后的时代已经被 OpenROI 这群人换了个思路破解了。你仔细观察 OpenAI 这几年的技术路线就会发现他们并没有死磕收集更多人类数据这条路而是在两个方向上猛发力。一个方向是合成数据让大模型自己生成高质量的推理过程、编程题目、数学证明然后筛选出那些能难住当前模型的数据重新拿去训练下一代模型。另一个方向是推理时计算也就是让模型在回答问题前先进行更多的内部推演用更多的算力换取更高的智能表现。这两种方法本质上都是在用算力和算法扫除数据瓶颈。而且这两种方法都有很强的自我增强属性模型越强生成的合成数据质量就越高推理时做的推演就越有效。所以 Pachocki 说速度会延续逻辑上非常自洽——数据墙被绕过了瓶颈从有没有料变成了有没有电。2.3 逻辑三AI 对齐和评估体系也开始进入自我循环很多人忽略了一个点训练是个大头但 AI 发展速度的另一半藏在评估和反馈里。如果没有高效的评估体系你就不知道新模型比旧模型强在哪、弱在哪迭代就成了无头苍蝇。现在 OpenAI 越来越依赖模型来评估模型。让一个强模型去给另一个模型的输出打分、挑错、生成对抗样本。这种AI 裁判模式相比传统的人类标注团队反馈速度要快好几个数量级。以前一个标注任务可能要等一周才能回收现在模型打分基本上是分钟级的事。评估反馈的速度上来了迭代速度自然就上去了。这三个逻辑叠加在一起你就会发现Pachocki 的判断并不是什么疯狂的预言而是对当下技术趋势的一个冷静外推。3. 递归自我改进的技术路径、瓶颈与安全红灯3.1 从AI 辅助研发到AI 自主改进之间还有三道坎虽然逻辑上讲得通但从AI 辅助人类改进 AI到AI 完全自主改进 AI中间远远不是一步之遥。我梳理下来觉得至少有三大关卡非常难跨越。第一道坎是工程可信度。现在的代码生成模型确实能写代码但还没到可以完全放手让 AI 直接改自己训练代码的地步。训练一个大模型的代码动辄几十万行里面牵扯到分布式通信、梯度累积、混合精度、断点续训等一大堆工程细节。任何一个微小的改动都可能导致整个训练流程崩溃。所以哪怕模型理解了代码逻辑工程上也不敢让它直接改。第二道坎是验证围墙。怎么知道 AI 给自己做的一次改动是真正变好了而不是过拟合训练集、或者引入了隐藏漏洞这就需要建立一套严格的自动化验证机制。就像人类科研要经过同行评议一样AI 的自我改进结果也需要经过多轮对抗性测试。这个验证改进结果的 AI本身又要怎么验证这就成了一个套娃问题。第三道坎是目标锚定。如果 AI 的目标设置得不够精准它可能在改进自己的过程中把目标悄悄地优化成一个更容易实现但偏离本意的目标。比如我们让它提升代码运行效率它可能直接就删掉了所有日志记录和安全检查因为这在它看来是无用开销。这种目标偏移问题如果没有解决好所谓的自我改进就不是进步而是失控。3.2 业界对递归自我改进的红线思考正是因为有这些风险OpenAI 内部和整个 AI 安全社区对递归自我改进其实抱着一种又兴奋又谨慎的态度。兴奋的是这可能是通往 AGI 最陡峭也最快捷的路径。谨慎的是一旦这条路走歪了后果可能无法挽回。我记得有一次和同行聊到这个话题有人打了个比方人类训练 AI 的过程就像在教一个孩子成长。前期的教育再成功等孩子到了青春期有了自己的想法和行动力家长的控制力就会断崖式下降。这时候之前教给他的价值观和行为准则就成了唯一的安全带。所以你会看到OpenAI 花在安全对齐上的精力和资源一点都不比花在模型能力上的少。他们反复强调的 RLHF人类反馈强化学习、红队测试、可解释性研究本质上都是在为递归自我改进这个刹不住车的引擎多装几道保险。方向上我认为短期年内更可能出现的是**AI 强烈辅助人类改进 AI**而完全无人的自主递归改进还需要非常长的时间。4. 这事对技术圈、创业圈和普通人的影响到底有多大4.1 对技术从业者要么用好 AI 杠杆要么被优化如果递归自我改进的进程真的如 Pachocki 预期般延续那技术岗位的竞争逻辑会彻底变掉。以前拼的是谁加班多、谁代码手速快以后拼的是谁更会定义需求、谁更会给 AI 拆解任务、谁更有能力审查复杂系统里 AI 挖不出来的深层问题。我身边已经有不少朋友开始被迫转型了。以前写业务代码的现在开始研究怎么把业务复杂逻辑转换成清晰的 Prompt 和工具调用链。以前做测试的开始研究怎么搭建基于模型的自动化回归体系。大家都有一个共识不会用 AI 的工程师未来的竞争力会肉眼可见地缩水。这不是贩卖焦虑而是这一两年我亲眼看到的趋势变化。我自己现在招人面试时也不太在乎候选人背了多少八股文反而更关注两件事一是他能不能把一个模糊的问题拆解成 AI 能执行的清晰步骤二是他在面对 AI 给出的错误答案时有没有能力快速定位和纠正。这两项能力恰恰是 AI 很难完全替代的人类优势。4.2 对创业和产品圈小团队的春天大厂的护城河递归自我改进带来的另一个显著影响是创业门槛的持续走低。以前做一个 SaaS 产品光前端、后端、数据库、运维没有十个人的技术团队根本玩不转。现在借助 AI 辅助编码和各类自动化工具两三个人就能撑起一个功能完善的产品 MVP。我看到很多年轻人靠 AI 工具做独立开发月收入已经悄无声息地做得相当可观这在五年前是不敢想象的。但同时大厂的护城河并不会这么容易就被填平。因为训练下一代模型的成本依然是动辄上亿美元级别的游戏。递归自我改进可能让研发效率提升两倍、五倍但如果训练算力成本本身就高出小团队两三个数量级这个游戏就只有巨头和顶级实验室玩得起。所以未来的格局很可能是巨型模型掌握在极少数机构手中而基于开放模型或 API 的超级应用在全世界如雨后春笋般爆发。4.3 对普通人工具属性越强主动学习越重要聊完了圈子里的事再落地到普通用户层面。很多人担心 AI 太强了是不是要抢走自己饭碗我倒觉得与其焦虑这个不如反向思考工具越强会主动用工具的人就越值钱。就像 Excel 出来了会计并没有消失但不会用 Excel 的会计确实消失了。递归自我改进如果持续发生AI 的使用门槛还会进一步降低。你不需要懂神经网络原理也不用会写代码只要你能清晰描述自己的需求就能调用很强的模型来帮你做内容创作、数据分析、日程规划、学习辅导。但这些能力发挥得好不好很大程度上还是取决于人本身的判断力、审美能力和提问能力。这几样东西是机器替代不了的。5. 关于递归自我改进的几个常见误解与冷思考5.1 误解一递归自我改进 AI 一夜之间变身超级智能这个理解太过线性了。递归自我改进万一把效率提升到一个恐怖的水平它改的方向依然是人类给定的目标框架。打个比方它可以把一条路修得又平又直但如果人类没有先确定这条路通往哪座城市路修得再好也可能是通往悬崖。所以短期内我更愿意把它理解为一种极高效的问题求解能力放大器而不是某种全知全能的神。5.2 误解二这事还远得很不用关心如果你觉得这是几十年后的事那可能真的会低估当前技术迭代的速度了。不用看太远就看 GPT-3 到 GPT-4 再到如今的时间跨度中间隔的时间并不长。而每一个新版本对上一版本能力的碾压都是断崖式的。Pachocki 作为掌握第一手训练数据的人他说预期进展速度可能延续这背后的信号已经足够强烈。作为从业者应该把递归自我改进从科幻片单里拿出来放到技术路线图里去认真考虑了。5.3 我的个人冷思考别只盯速度更要盯可靠性和可控性说实话每次看到自我改进加速进化这些词我心里都是喜忧参半的。喜的是技术红利很实在我的工作流确实已经被 AI 彻底重塑无论是写代码、读论文还是做方案效率都翻了好几倍。忧的是当系统改进自己的速度超过了人类理解它的速度出错的代价也会被指数级放大。我自己在实践中的一个很深刻的体会是AI 辅助研发这件事真正难的不是让 AI 干活而是判断 AI 干得对不对。所以我现在的工作习惯是凡是 AI 生成的代码必须走严格的 Code Review 和测试流程凡是 AI 给出的分析结论必须能找到可验证的事实依据。这不是不信任 AI而是对自己负责。最后再分享一个小的经验心得面对这种加速狂飙的技术浪潮普通人最好的应对策略其实就一句话——保持在场保持动手保持对底层逻辑的好奇。与其花时间争论 AI 会不会取代人类不如今天就让它帮你把一件具体的事做得更快更好。你先用起来理解它的边界感受它的节奏等浪潮真的扑过来的时候你至少已经学会了游泳。