
为什么弱模型也能执行对improve计划模板的三大核心设计原理【免费下载链接】improveUse your most capable model to audit your codebase and write plans for cheaper models to execute.项目地址: https://gitcode.com/gh_mirrors/imp/improveimprove 是一个开源的 AI 代码审计技能它用最强的大模型审计代码库、写出自包含的实现计划再交给更便宜、更弱的模型去执行。本文将拆解 improve 计划模板背后的三大核心设计原理帮你理解弱模型为什么也能把事做对。 先记住一句话计划才是产品本身。模型强弱只是表象真正决定执行成败的是计划的质量。you → /improve (expensive model, advises) plans/ → 001-fix-n-plus-one.md (self-contained specs) other agent → implements, tests, ships (cheap model, executes)一、弱模型为什么会执行错先看清短板在哪在 skills/improve/references/plan-template.md 的开头作者对执行者模型做了非常诚实的假设假设它擅长遵循明确指令但不擅长填补空白、从歧义中恢复以及判断什么时候该停下来。翻译一下就是弱模型不是不聪明而是有三个致命短板短板典型翻车现场缺上下文按上面讨论的模式写——它根本没看上面的讨论靠猜填补空白指令含糊时自由发挥改出一堆计划外的代码不知道何时停发现现实和计划对不上硬着头皮继续创造性修复所以 improve 的设计思路很反直觉不去责怪模型而是把智能前置。理解代码库、判断值不值得做、写规格说明——这些智能会复利的部分交给最强模型执行交给便宜模型。二、原理一自包含上下文——执行者永远不需要回忆模板的第一条铁律每个计划必须完全自包含。计划里禁止出现如上所述参见审计报告这类字样——因为执行者从未见过顾问会话没见过审计过程也没见过其他计划。一个真实例子仓库里的 examples/001-extract-shadow-config-resolution.md 计划把以下信息全部内联进了文件✅ 涉及的每个文件的准确路径以及它的作用一句话说明✅当前状态的代码摘录带file:line行号标记让执行者能确认自己看对了地方✅ 仓库的代码规范并指向一个样板文件照着写✅ 经过实地验证的命令表安装、测试、Lint而不是拍脑袋猜的给团队写计划的启发把你的口头共识写进文档。凡是执行者需要靠记得才能完成的信息都等于计划写废了一半。三、原理二验证门槛——用命令替代判断弱模型最弱的地方是自我评价。问它改好了吗它大概率会说好了。improve 的解法是每一步都以一条命令 预期输出收尾。执行者不需要判断自己是否成功只需要跑命令、对结果。比如示例计划里的每一步都长这样Verify:pnpm shadcn:test→ 全部通过包括新增的 4 个测试而完成标准Done criteria更是全部写成机器可检查的清单某条命令退出码为 0某次grep不再匹配任何内容git status确认没有改动范围外的文件对比一下两种写法差距一目了然❌ 弱模型友好的反面✅ improve 的写法确保功能正常工作pnpm typecheck退出码为 0把重复逻辑抽出来grep -rn 旧模式 src/无匹配为什么这能让弱模型执行对因为判断对不对被外包给了确定性工具。执行者从决策者降级成了操作员——而操作员恰好是弱模型最擅长的角色。四、原理三硬边界与 STOP 条件——教会模型什么时候该停这是最体现设计功力的一条。弱模型在计划与现实不符时最危险它会自由发挥。improve 干脆把停止写进计划里。每个计划都包含两块内容1. 明确的范围边界范围内唯一允许修改的文件逐一列出范围外看起来相关但千万别碰逐一列出甚至解释为什么不碰示例计划里就专门写了一条init.ts虽然处理配置但它走的是交互式流程不属于本次重复逻辑的范畴——不要碰。2. STOP 条件逃生舱如果出现 X停下来上报不要自由发挥。典型 STOP 条件包括当前代码与计划里的摘录对不上代码库在计划写就之后发生了漂移某一步的验证在合理修复尝试后仍然失败两次修复需要触碰范围外的文件计划还会在头部盖上 git 提交号的印章执行者开工前先跑一次机械的漂移检查——发现代码变了就触发 STOP而不是硬执行一份过期的计划。五、快速上手三步把计划交给便宜模型 安装只需一行命令支持 Agent Skills 格式的任意 agent 均可npx skills add shadcn/improve典型使用流程在仓库中运行/improve强模型完成侦察、审计、复核产出发现表格你挑选要立计划的条目计划落入plans/目录每份一个自包含文件运行/improve execute 001它派一个更便宜的执行模型在隔离的 git worktree 里执行计划然后像技术负责人一样审查 diff给出通过 / 打回修改 / 阻断的裁决——合并与否永远由你决定完整流程定义见 skills/improve/SKILL.md执行与对账机制见 skills/improve/references/closing-the-loop.md九大审计类别清单见 skills/improve/references/audit-playbook.md。六、自检清单用 6 个问题检验你的计划模板这套原理不只属于 improve。如果你要为自己的团队或你的 AI 执行者写交接计划用 skills/improve/references/plan-template.md 末尾的质量门槛自查一个从未见过这个仓库的模型只凭计划文件就能执行吗每个验证都是命令 预期结果而不是确保它能跑每一步都点名了精确的文件和符号而不是相关模块STOP 条件是针对本计划的真实风险写的而不是套话审阅者只看为什么重要 完成标准就能理解要批准什么范围外清单存在且解释了为什么不碰那些看起来相关的文件七、总结为什么弱模型也能执行对答案藏在三大设计原理里自包含上下文——把所有需要回忆的信息内联进文件消灭歧义验证门槛——用命令和预期输出替代模型的主观判断硬边界与 STOP 条件——在现实偏离计划时强制弱模型停下来上报而非自由发挥本质上improve 把智能和执行做了分离最贵的模型负责理解、判断与规格最便宜的模型负责按图施工。当计划写得足够好时执行者的智力下限就不再是项目的天花板。 更多细节可阅读 README.md 中的完整使用说明。【免费下载链接】improveUse your most capable model to audit your codebase and write plans for cheaper models to execute.项目地址: https://gitcode.com/gh_mirrors/imp/improve创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考