AVO 屠榜 ARC-AGI-3!英伟达给 Agent 戴上“最强外脑”

发布时间:2026/8/25 14:58:05
AVO 屠榜 ARC-AGI-3!英伟达给 Agent 戴上“最强外脑” AI-AgentLLM models 握手之言在最新的 ARC-AGI-3 测试中出现了一个极具戏剧性的技术对比Claude Opus 5 独立作战仅拿到 30.16% 的分数但一旦被接入英伟达华人团队研发的 AVO 智能体架构它竟奇迹般地通关了全部 25 个环境、183 道关卡以 6624 步的极低消耗斩获 100 分满分。最令人振奋的是这场“性能翻倍”的魔法并非来自模型本身的微调或重训而是纯粹源于 Agent 运行时Harness的系统级优化。更有趣的是这套在 AGI 测试中“大杀四方”的系统其本职工作其实是自动优化 GPU CUDA 内核。它曾连续自主运行 7 天成功编写出比 FlashAttention-4 还要快 10.5% 的注意力算子。当整个行业还在大模型的参数规模和榜单分数上“死磕”时英伟达用 AVO 抛出了一个灵魂拷问决定 Agent 智能上限的或许从来不只是模型本身系统架构的降维打击同样能拉开天堑。ARC-AGI-3----https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdfARC Prize - What is ARC-AGI?1ARC-AGI-3别让排行榜定义什么是智能ARC-AGI-3被业界视为衡量真实流体智能的“炼狱级基准测试”。这套评测不会向AI提供任何规则说明与任务指引直接将模型投入全然陌生的交互式游戏场景。AI唯有不断尝试操作、观测画面反馈自主摸索底层机制推演出通关策略。有的关卡触碰方块瞬间天旋地转画面直接翻转90度有的关卡点击只切换格子颜色毫无征兆。难度不是线性增长是断崖式飙升——越往后越像在解一道没有答案的谜题。顶尖大模型集体翻车局部看得清清楚楚全局一片混沌遇到新题就强行套旧解侥幸通关一次就以为自己懂了下一关立马现原形。Claude Opus 5 单打独斗第一关轻松过第二关原地卡死屡试不爽。而英伟达 AVO没看过一张图没用过一个图像Token仅凭64×64的纯文本网格一路推平所有关卡——零失误。2同样的模型凭什么多出70分答案藏在两个机制里AVO并未对底层大模型本身做出改动其性能层面的跨越式提升完全依托外围两层核心架构设计这也是新一代Harness运行时最为关键的能力。①持久记忆攻克上下文窗口带来的信息遗忘痛点通用大模型天然受限于上下文窗口容量当历史信息超出承载上限过往试错记录、调试结论、完整推理链路都会直接丢失。智能体只能重启任务重复经历已经踩过的误区。AVO构建了独立的外部持久记忆库完整留存每一轮操作尝试、评测数据、编译器输出内容与推理全过程。即便上下文完成重置智能体依旧能够调取历史存档基于现有进度持续推进无需一切从零开始。②监督器 Supervisor打破智能体循环试错困局主智能体承担方案迭代、测试验证等执行工作监督器不参与具体实操专职全程追踪完整行动轨迹。一旦识别智能体陷入重复循环、持续无效试错或是任务进展停滞监督器将主动介入干预引导智能体切换全新解题思路规避无休止消耗算力与Token的死胡同。正是持久记忆监督器这套组合补齐了智能体长时程自主任务落地的最大短板。AVO与近期备受关注的DeepSeek Harness、OpenAI Codex Harness同属一条赛道大模型专注推理思考Harness系统统筹记忆存储、状态管控、工具调度与故障恢复。3GPU内核优化器顺手给AI推理打了一个样AVO 的出生证上写的不是“AGI 挑战者”而是“GPU 算子自动进化器”。全称 Agentic Variation Operators——智能体式变异算子。在英伟达 B200 黑威尔平台上它干的事听起来像是个不要命的工程师自己翻 CUDA 手册、自己改内核代码、自己跑测试、自己读性能报告然后自己推翻重来一遍又一遍。连续 7 天不眠不休。500 多个优化方向被探索40 个有效内核被产出。多头注意力内核比 cuDNN 快 3.5%比 FlashAttention‑4 快 10.5%换到 GQA 算子只给了 30 分钟自主迭代就跑赢了主流开源方案。但最让人后背发凉的不是这些数字——而是优化 GPU 算子的那套循环和闯关 ARC‑AGI‑3 的那套循环几乎一模一样。换掉的只是任务接口和评测逻辑核心机制原封不动。AVO 真正证明了一件事能跨领域复用的从来不是某个领域的知识而是一套能自己扎根、自己生长的系统机制4:“谁来都一样”AVO华人团队如何用底座思维打破模型壁垒从“盲编程”到“算力收割”英伟达AVO的生态卡位战AVO项目的成功离不开其堪称豪华的23人研发团队。该团队汇聚了开源深度学习领域的顶尖力量许冰MXNet作者、陈天奇XGBoost/TVM缔造者、叶子豪FlashInfer作者等华人技术领袖的加入为其奠定了坚实的技术底座。团队以“盲编程”为初衷致力于构建一个低人类干预、高自主性的复杂工程任务执行系统。在技术路线上AVO采取了开放兼容的策略能够无缝适配GPT-5.6 Sol、Claude Opus 5等多种底层大模型。这种“模型无关”的设计恰恰暴露了英伟达真正的商业野心。英伟达无意在大模型应用层与科技巨头们正面交锋而是选择降维打击抢占“Agent运行时Harness”这一基础设施层。其商业逻辑极为清晰大模型的竞争是暂时的但长时程Agent任务的爆发将带来确定性的算力饥渴。无论上层模型如何洗牌底层的算力消耗最终都将转化为英伟达硬件的护城河与利润源。5未来AI时代什么才是衡量通用智能体的新标尺六周之内ARC-AGI-3接连出现三次满分榜单含金量快速下滑。但相比一张满分答卷AVO带来的思考更加重要大模型不等于完整Agent。模型决定能力天花板Harness运行时决定上限能否落地面对长时程任务系统工程的价值堪比模型本身。赛道竞争重心正在迁移不再单纯卷模型参数而是比拼记忆管理、故障恢复、策略纠偏等系统能力。通用智能体最难攻克的不是单次对话而是持续试错、自我修正、跨场景迁移的闭环能力。理性来看AVO目前仅有技术论文尚未开源代码满分结果来自公开测试集私有测试集表现有待检验距离工业化落地还有不小差距。最后延伸讨论① 模型趋同之后Harness 会是 Agent 竞争的唯一变量吗② 当 AI 具备 7×24 小时自主迭代工程代码的能力工程师的核心价值会迁移到哪里过去两年行业默认的公式是更强的 AGI 更大的模型 更多的数据。英伟达用 AVO 把这个公式推翻了——同一个模型换一套 Harness结果天差地别。70 分的差距不是模型能力的差距是系统架构的差距。这提醒我们一件事当大家都挤在堆参数的赛道上时系统层的创新可能才是那个被严重低估的变量。AGI 的终点不止一条路AVO 把 Harness 这条路踩实了。