Claude Code与Codex真正的护城河:不是大模型,而是Agent Harness

发布时间:2026/8/5 16:44:14
Claude Code与Codex真正的护城河:不是大模型,而是Agent Harness 写在前面欢迎大家关注Rocky的知乎Rocky Ding《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book欢迎大家StarRocky最新撰写的10万字AI AgentAI智能体深入浅出全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识欢迎大家加入https://t.zsxq.com/33pJ0大家好我是Rocky。核心导读过去一年很多人讨论 Coding Agent习惯先问一句底层到底用了哪个模型这个问题当然重要但它只问对了一半。模型决定能力上限真正决定一个编码智能体能否在复杂仓库里持续交付的是模型外部那套运行系统它如何理解项目如何组织提示词如何调用工具如何控制权限如何压缩历史如何恢复任务又如何让多个 Agent 协作而不互相踩踏。Sebastian Raschka 把这套系统概括为Agent Harness并用一个纯 Python 的 Mini Coding Agent 拆成六个组件实时仓库上下文、提示词结构与缓存、工具与权限、上下文治理、会话记忆、有边界的子代理。Rocky认为这六个组件最值得关注的地方不是给 Claude Code 或 Codex 画一张功能清单而是揭示了 Coding Agent 的本质Coding Agent 不是“会写代码的模型”而是一套把不稳定生成能力约束成可验证软件交付的生产系统。因此Claude Code 与 Codex 的竞争也不能被简化为模型榜单之争。更准确的工程表达是有效编码能力约等于模型能力、上下文质量、工具可靠性、状态连续性与权限可控性的乘积。这不是严格数学公式而是一种系统判断。任何一项接近零模型再强也可能在真实仓库里表现得像一个聪明但不可靠的实习生。一、先纠正一个误区Harness不是模型的替代品围绕 Coding Agent行业里常见两个极端判断。一种判断是“模型决定一切”只要换上更强的基础模型代码搜索、修改、测试与修复都会自然变好。另一种判断则是“模型已经同质化未来只看 Harness”。两种说法都过度简化了问题。模型仍然决定推理深度、代码理解、指令遵循和错误恢复的上限。一个无法稳定输出结构化工具调用、不能理解跨文件依赖的模型不会因为套上一层漂亮 CLI 就突然变成优秀工程师。但反过来同一个模型放在普通聊天框和具备仓库导航、工具执行、状态管理、测试反馈的 Agent 中确实会呈现完全不同的任务完成能力。Raschka 用“发动机与整车”解释这种关系普通 LLM 是发动机推理模型是愿意消耗更多推理计算的强化发动机Agent Harness 则提供底盘、传动、仪表和控制系统。这个比喻有一个很重要的隐含条件好车不可能没有好发动机但好发动机也不会自动长出刹车、方向盘和道路规则。所以本文不会复述“某几个旗舰裸模型已经相差无几”这类缺少统一实验条件的判断。不同产品的系统提示词、工具集合、上下文预算、推理预算和后训练策略都不透明终端体验不能直接反推出裸模型能力。我们能严谨讨论的是 Harness 为什么会放大模型能力以及哪些公开机制构成了这种放大。二、Coding Harness不是一层壳而是三层系统“Harness”常被翻译为外壳或脚手架但这两个词都容易让人低估它。它不是在模型外面包一层 UI而是至少包含三个层次模型层基础模型与推理模型负责理解、规划和生成。Agent循环层观察环境、检查证据、选择下一步、执行动作再根据结果继续迭代。运行时支撑层仓库上下文、工具、权限、缓存、记忆、会话、沙箱和错误处理。真正的工程难点集中在后两层。聊天模型可以一次性给出代码建议Coding Agent 却要面对一个不断变化的环境文件会被修改测试会失败命令会超时用户可能中途补充要求工具输出还会迅速吃满上下文。这意味着 Agent 每一轮都不只是“生成下一段文字”而是在维护一个受约束的状态机当前任务是什么已经知道什么哪些结论过期了下一步动作是否安全执行结果是否足以改变计划何时应该停止。Raschka 的六组件框架本质上就是对这个状态机的六个关键工程面进行拆解。三、为什么Mini Coding Agent值得看它把复杂产品拆回最小闭环Claude Code 和 Codex 都是成熟产品直接研究产品体验很容易把模型能力、产品设计和运行时工程混在一起。Mini Coding Agent 的价值恰恰在于小它用一个可读的 Python 文件把六个组件映射到具体代码。它会收集工作区快照构造稳定提示前缀暴露结构化工具对高风险动作请求审批保存完整转录与工作记忆并允许主 Agent 把有限任务委派给子代理。默认后端是 Ollama示例模型为qwen3.5:4b没有额外 Python 运行依赖。但必须强调边界作者在 README 中明确说明这个项目为可读性而不是健壮性优化。它的工具协议、错误恢复、并发控制、沙箱隔离和模型适配都不能代表商业产品水平。这反而让它更适合教学。我们要看的不是“几百行代码复刻 Claude Code”而是一个 Agent 最少需要哪些闭环才能从文本生成器变成可执行系统。四、组件一实时仓库上下文先建立事实地基用户说“修一下测试”时这句话几乎没有可直接执行的信息。Agent 至少要知道当前目录是不是 Git 仓库分支和工作区是否干净项目有哪些说明文件测试命令写在哪里目录结构如何哪些文件刚被改过。这就是实时仓库上下文的任务。Mini Coding Agent 的WorkspaceContext会把 Git 状态、提交信息、项目说明与文件结构组织成工作区摘要再与用户请求合并。这里最容易犯的错误是把“上下文越多越好”当成原则。事实上优秀 Harness 需要的是稳定事实的高信噪比摘要不是把整个仓库塞给模型。OpenAI 的公开 Codex 仓库中可以看到独立的AGENTS.md发现、合并和作用域处理逻辑。这类机制的价值不是多读一份文档而是把人类团队的长期约束变成 Agent 每轮都能获得的项目事实测试怎么跑、哪些目录不能改、代码风格是什么、完成后如何验收。Rocky认为未来团队真正有复利的资产不只是代码库还包括能被 Agent 稳定读取的“工程语境”结构清晰的 README、局部生效的 AGENTS.md、可执行测试、明确的错误信息和可追溯提交记录。仓库越机器可读Agent 的有效能力越高。五、组件二提示词结构与缓存优化的是每一轮的边际成本Coding Agent 的提示词不是一段静态文本。它通常由两类信息组成相对稳定的前缀行为规则、工具定义、权限说明、工作区摘要。持续变化的状态最新请求、近期转录、工作记忆、工具结果和文件变更。如果每轮都重新排列所有内容哪怕语义一样也可能破坏前缀稳定性让缓存复用失效。Mini Coding Agent 因此把build_prefix与每轮变化状态分开最后再组装成一次模型请求。这项设计同时影响成本、延迟和模型表现。稳定前缀越容易复用重复处理的 token 越少变化信息越靠近当前任务模型越容易关注最新状态。不过“把稳定内容放前面”只是获得缓存收益的必要条件之一不代表任何模型服务都会自动命中缓存。缓存边界、最小长度、失效规则和计费方式由具体提供方决定。严谨的 Agent 团队应该观察真实的缓存命中率和首 token 延迟而不是仅凭提示词结构宣称完成了优化。更深一层看提示词结构不是文案工作而是运行时数据布局。它和数据库索引很像逻辑内容相同组织方式不同查询成本和稳定性就会不同。六、组件三工具、校验与权限把自然语言意图变成受控动作工具调用是聊天助手与 Agent 的分水岭但“能调用 shell”并不等于“具备工程执行力”。一个可靠的动作链至少包括模型输出结构化工具名与参数。Harness 检查工具是否存在、参数是否完整。运行时检查路径、网络和命令是否超出权限边界。高风险动作进入审批低风险动作直接执行。执行结果被裁剪成有边界的反馈再送回模型。Mini Coding Agent 把读取文件、搜索、写入、补丁、shell 与 delegate 都定义为命名工具并在validate_tool中检查参数和路径在approve中处理高风险动作。它还提供ask、auto和never三种审批模式。公开的 Codex 源码进一步展示了文件系统权限、网络权限、工作区写入和权限配置文件等机制Anthropic 的公开 Claude Code 仓库也提供 Bash 沙箱设置示例。这些公开材料足以证明权限并不是附加在 Agent 外面的合规按钮而是运行时的一等对象。Rocky认为一个工具系统的成熟度不应由“支持多少工具”衡量而应由三个问题衡量动作能否被验证失败能否被解释风险能否被限制。工具数量扩张很容易建立稳定的输入输出契约、幂等性和回滚路径才难。七、组件四上下文治理决定Agent会不会越干越笨长任务最典型的失败不一定是上下文窗口耗尽而是上下文质量先崩掉。Agent 会反复读取同一文件收集几千行日志保留已经过期的计划还可能把每次工具输出原样追加到历史。窗口看起来还有空间但真正有用的信息被噪声淹没模型开始忘记目标、重复搜索或依据旧状态行动。Raschka 的最小实现使用三类策略长输出裁剪、重复读取去重、旧转录压缩。近期事件保留较高细节远期事件只保留与当前目标相关的摘要。这里有一个非常重要的产品判断上下文窗口大小是容量指标上下文治理才是质量指标。窗口从 200K 增加到 1M并不会自动解决错误信息长期滞留、事实冲突、重复读取和注意力稀释。真正优秀的 Harness 需要知道什么应该完整保留什么可以压缩什么已经失效什么必须重新从环境获取。它管理的不是 token而是决策证据的新鲜度。八、组件五会话记忆把“历史记录”与“当前状态”分开上下文压缩回答的是“下一次提示词应该带什么”会话记忆回答的是“系统应该长期保存什么”。这两个问题经常被混为一谈。Mini Coding Agent 把状态分成两层完整转录保存用户输入、工具调用、执行结果和模型响应服务于审计、恢复和问题追踪。工作记忆只保留当前任务、关键文件、近期结论和待办服务于下一轮决策。完整转录追求可恢复工作记忆追求可行动。前者不应该因为提示词预算而丢失后者也不能退化成无止境追加的日志。这对企业落地尤其重要。没有持久转录Agent 的修改过程难以审计没有蒸馏后的任务状态恢复会话只能把海量历史重新喂给模型。二者分离才能同时支持长任务连续性、成本控制和责任追踪。九、组件六有边界的子代理真正稀缺的是协调而不是并行子代理的直觉很诱人主 Agent 写代码多个子 Agent 同时搜索符号、阅读配置、定位失败测试理论上可以显著缩短任务时间。但并行也会引入新的系统成本重复读取、结果冲突、文件竞争、递归委派、上下文复制和合并开销。如果多个 Agent 都能修改同一组文件速度可能上升返工也可能同步上升。Mini Coding Agent 的delegate会限制递归深度与最大步数让子 Agent 继承必要上下文并把结果返回主循环。OpenAI Codex 的公开仓库中也能看到独立的子代理 spawn 与控制实现Anthropic 的公开仓库则包含 Agent 定义、工具限制与插件开发规范。这些证据能确认两种产品都公开暴露了多 Agent 能力表面但不能据此推断它们拥有相同的调度器、共享记忆或冲突解决机制。Rocky认为多 Agent 的核心指标不是“同时跑了几个 Agent”而是单位有效结论的协调成本。只有任务边界清晰、写入所有权明确、结果可验证时并行才会转化为 Goodput否则只是把 token 消耗和冲突速度一起放大。十、六组件不是六个插件而是一条生产闭环把六个组件分开讲是为了建立心智模型在真实系统里它们高度耦合。仓库上下文会进入稳定提示前缀提示词结构影响缓存和注意力工具结果推动状态变化长输出触发上下文压缩完整转录支持恢复工作记忆又成为子代理继承的任务状态。任何一个环节设计不当都会向后放大。因此Agent Harness 不是六个功能模块的简单相加而是一个反馈系统。好的系统会让模型在每一轮获得更干净的事实、更明确的动作边界和更短的验证回路差的系统则不断把旧错误、冗余日志和模糊权限重新注入模型。这也是为什么同一模型在不同 Coding Agent 中会呈现不同体验。不是某个神秘提示词让模型突然变聪明而是系统持续提高了有效上下文比例、动作成功率和错误恢复速度。十一、公开证据能说明什么不能说明什么为了避免把分析写成产品传说需要把三类证据分开。证据层可以确认不能直接推出Raschka原文与Mini Coding Agent六组件框架及其最小实现逻辑Claude Code、Codex采用完全相同的内部架构OpenAI Codex公开仓库Codex CLI是本地Coding Agent公开代码存在AGENTS.md上下文、权限/沙箱和子代理控制Codex App、CLI、Cloud所有表面内部完全一致Anthropic Claude Code公开仓库公开提供Agent、Hooks、工具限制和Bash沙箱配置表面Claude Code闭源运行时的完整提示词、记忆和调度策略产品使用体验某种配置下的端到端结果裸模型能力、后训练贡献或Harness单项贡献这一区分也解释了为什么本文没有延续微信整理稿中的具体模型强弱和产品先后判断。模型版本快速变化且不同产品的测试环境不可比。没有统一模型、统一任务、统一工具、统一推理预算的消融实验就不能把体验差异精确归因于某一个组件。六组件框架是有解释力的工程模型不是两家厂商共同发布的架构标准。十二、评估Coding Agent别再只看一次性Benchmark传统代码 Benchmark 通常给定完整问题和测试衡量一次任务是否通过。但企业仓库里的难点更复杂需求不完整、说明分散、测试昂贵、权限受限、会话很长还可能需要多人协作。因此团队至少应该同时观察以下指标任务成功率在真实仓库约束下最终是否通过测试和人工验收。工具调用失败率参数错误、路径越界、命令超时和无效重试各占多少。验证闭环长度从修改到发现错误、修复错误平均需要多少轮。上下文有效率重复读取、过期状态和无关日志占用了多少预算。缓存命中与延迟稳定前缀是否真正降低了重复计算成本。会话恢复质量中断后能否继续正确计划而不是重新探索整个仓库。审批与风险事件高风险动作是否被识别人工审批是否集中在真正重要的节点。多Agent Goodput并行带来的有效交付增量是否大于协调与冲突成本。这里的关键不是再造一套漂亮仪表盘而是把“模型感觉很聪明”转换为可运营的工程指标。没有这些指标团队很难判断一次升级究竟来自模型、提示词、工具还是上下文治理。十三、对开发者、团队与创业者意味着什么对个人开发者来说最有价值的能力不再只是会写 Prompt而是把仓库整理成 Agent 可工作的环境说明清晰、测试可运行、权限可配置、任务可分解、结果可验证。对工程团队来说不要把 Coding Agent 当成一个统一采购的软件席位。真正的落地对象是研发流程哪些工具允许执行哪些步骤必须审批什么状态需要持久化长任务怎样恢复Agent 输出如何进入代码评审与 CI。对 Agent 创业者来说模型调用不是护城河单一 IDE 插件也很容易被吸收。更持久的价值来自行业工作流、可验证工具链、组织记忆、权限治理和真实任务数据。用户不会长期为“会聊天的代码框”付费但会为更高的交付成功率、更短的验证周期和更可控的工程风险付费。对投资人来说看到一个 Demo 能自动改代码时应该继续追问它如何构建上下文如何处理失败如何审计动作如何恢复任务如何证明多 Agent 带来的是 Goodput 而不是 token 浪费。结语模型决定上限Harness决定能力能否稳定兑现Coding Agent 的下一阶段不会停止模型竞争。更强的推理、更好的代码理解和更可靠的工具调用后训练仍然会抬高能力上限。但当模型进入真实研发环境竞争就从“能不能生成代码”转向“能不能持续完成工作”。实时仓库上下文、稳定提示结构、结构化工具、权限边界、上下文治理、会话记忆和有界委派共同决定模型能力能否被转化为可交付结果。Rocky认为Agent Harness 的长期价值就是把概率模型变成一套可管理的生产力系统它不消除不确定性而是让不确定性被约束、被验证、被恢复、被审计。模型是智力供给Harness是生产关系。真正的护城河不是让模型多说几句而是让它在复杂世界里把事情做完。核心参考资料极市平台《Claude Code与Codex六大组件拆解》https://mp.weixin.qq.com/s/EiHYDV9xSIOuFcHlxrqMfwSebastian Raschka:Components of A Coding Agenthttps://magazine.sebastianraschka.com/p/components-of-a-coding-agentSebastian Raschka:Mini Coding Agenthttps://github.com/rasbt/mini-coding-agentOpenAI:Codex公开仓库https://github.com/openai/codexAnthropic:Claude Code公开仓库https://github.com/anthropics/claude-code推荐阅读Rocky一直在运营技术交流群WeThinkIn-技术交流群这个群的初心主要聚焦于技术话题的讨论与学习包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛欢迎大家入群一起学习交流请添加小助手微信Jarvis8866拉你进群1. 深入浅出完整解析AI AgentAI智能体的核心基础知识2025年可以说是AI Agent全面落地应用的元年因此Rocky在持续撰写对AI Agent的全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解同时不断跟进补充扩散模型的最新技术发展希望能给大家带来帮助深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识3. 入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识5. 深入浅出完整解析DeepSeek系列核心基础知识Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析深入浅出完整解析DeepSeek系列核心基础知识6. 深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识7. 深入浅出完整解析Stable Diffusion XLSDXL核心基础知识Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion XLSDXL核心基础知识8. 深入浅出完整解析Stable DiffusionSD核心基础知识Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析深入浅出完整解析Stable DiffusionSD核心基础知识9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析包括其在传统深度学习中的价值和在AIGC中的价值深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识10. 深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识对于AIGC时代中的“ResNet”——LoRA模型Rocky进行了深入浅出的全面讲解深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识11. 深入浅出完整解析ControlNet核心基础知识AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。ControlNet正是让AI图像创作社区无比繁荣的关键一环它让AIGC图像创作过程更加的可控更有助于广泛地将AIGC算法解决方案应用到各行各业中深入浅出完整解析ControlNet核心基础知识12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识AI绘画和AI视频是两个互相促进、相互交融的领域2024年无疑是AI视频领域的爆发之年Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识13. 深入浅出完整解析AIGC时代Transformer核心基础知识在AIGC时代中Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向成为AI技术架构大一统与多模态整合的关键核心基座大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析深入浅出完整解析AIGC时代Transformer核心基础知识14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识AIGC创作框架正是AIGC算法工作流的运行载体目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架到了AIGC时代Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识在AIGC时代中如何快速转身入局AIGC产业如何成为AIGC/LLM/AI Agent算法/开发工程师如何在学校中系统性学习AIGC/LLM/AI Agent知识斩获心仪的AIGC/LLM/AI Agent算法/开发offerDon‘t worryRocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍为大家答疑解惑希望能给大家带来帮助手把手教你成为AIGC/LLM/AI Agent算法/开发工程师斩获AIGC/LLM/AI Agent算法/开发offer16. AIGC产业的深度思考与分析2023年3月21日微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示自从1980年首次看到图形用户界面graphical user interface以来以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。Rocky也认为AIGC及其生态会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期未来随着AIGC的全面落地和深度商用会深刻改变我们的工作、生活、学习以及交流方式各行各业都将被重新定义过程会非常有趣。那么在此基础上我们该如何更好的审视AIGC的未来我们该如何更好地拥抱AIGC引领的革新Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点希望能帮助各位读者对AIGC有一个全面的了解深入浅出全面解析AIGC时代核心价值与发展趋势2025年版17. AI算法工程师的独孤九剑秘籍为了方便大家实习、校招以及社招的面试准备同时帮助大家提升扩展技术基本面Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍持续更新中18. 深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识GAN系列模型作为传统深度学习时代的最热门生成式Al模型在AIGC时代继续繁荣作为Stable Diffusion/FLUX系列大模型的“得力助手”广泛活跃于AlGC图像创作的产品与工作流中深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识