pstack的arena技能教程:N个模型赛跑同一任务如何挑选最优

发布时间:2026/10/8 13:22:42
pstack的arena技能教程:N个模型赛跑同一任务如何挑选最优 pstack的arena技能教程N个模型赛跑同一任务如何挑选最优【免费下载链接】pstack-claudeClaude Code, Codex, Copilot, Pi, OpenCode, Gemini, and Prime Agent versions of Potetos pstack. Rigorous agent workflows with Cursor primitives translated for other harnesses.项目地址: https://gitcode.com/GitHub_Trending/ps/pstack-claudepstack 是一款面向 Claude Code、Codex、GitHub Copilot、Pi 等 AI 编码工具的代理工作流技能集其中的arena竞技场技能专门用于多模型并行赛跑让 N 个大模型同时完成同一个任务再交叉评审、挑出最优方案作为基底把落选方案中的亮点移植进来最后统一验证。如果你怕一次生成就锁死在次优解上这篇 pstack arena 教程会带你完整走一遍 6 个阶段学会如何挑选最优。arena 技能能做什么arena 的核心思路只有一句话先分后合Fan out → Cross-judge → Pick → Graft → Verify。Fan out同一份提示词同时发给 N 个候选模型默认 3 个不同家族的模型每个模型独立产出一份完整作品和一份理由说明Cross-judge请一个与候选不同家族、只读的评审模型按评分标准给每个方案打分并推荐基底Pick父代理逐条对照评分标准亲自读完全部候选与评审意见互相印证选出最易维护、最易扩展的那份作为基底Graft把落选方案中真正值得移植的一两个亮点手工融入基底而不是机械粘贴Verify按证明它真的能跑的标准验证合成后的最终产物。完整流程定义见 arena 技能说明每个阶段都要求先在待办清单中登记再开始执行保证过程可追踪。如何触发 arena 技能运行环境触发方式Claude Code输入/pstack:arena或自然语言说 arena this、throw it in the arenaPi输入/skill:arenaCodex / Copilot按名称请求技能详见 平台映射说明任意环境交给poteto-mode路由任务涉及多个设计方向时它会主动调用 arena所有 58 个技能的命令对照表见 斜杠命令参考。arena 的六个阶段从出题到择优1️⃣ Frame把提示词变成合同N 个候选收到的是同一份提示词所以提示词就是合同。这一步要定义三件事交付物是什么每个候选要产出什么评分标准3-6 条可打分的成功判据这是后面挑选时裁判的工具候选看不到它参赛者名单每个候选写到独立路径git worktree 或/tmp/arena-slug/candidate-n/遵循先隔离再共享原则见 principle-separate-before-serializing-shared-state。2️⃣ Fan out一次消息派出 N 个并行子代理所有候选在一条消息中并行启动各自产出作品 简短理由。要求理由中写清楚考虑过哪些替代方案、为什么拒绝了它们。某个候选失败就按 N-1 继续并在合成记录中注明掉队者。3️⃣ Cross-judge引入第三方评委从评审模型池中选一个与父会话不同家族的模型派一个只读评审子代理它看到评分标准和各候选按路径标签区分逐条打分并推荐基底。注意——评审只在所有候选完成之后才启动避免干扰还在写作的候选。4️⃣ Pick逐条对照评分标准选基底挑选不看整体感觉而是逐条对照评分标准打分并与交叉评审的结论比对两者一致 → 确认选择两者分歧 → 说明有一方有偏见或标准含糊读两边理由再定。最终标准未来的维护者能在不破坏约束的前提下最轻松地扩展哪份作品两份打平时优先选边界更干净、API 更小的那份。5️⃣ Graft只移植一两个亮点重新走查每个落选方案找出值得移植的部分——信号通常每份只有一两个点。手工融入而非机械粘贴保证结果在同一个心智模型下保持连贯。两个重要判断N 个候选收敛到同一形态→ 强共识信号直接采用共识形态无需移植N 个候选 wildly 分歧→ 说明第 1 阶段的提示词没写好应该重新定义再跑而不是把分歧平均掉。6️⃣ Verify按 prove-it-works 标准验证合成产物必须经得起和任何其他产出相同的审视直接检查真实产物而不是它能编译这类间接证据见 principle-prove-it-works。验证暴露新问题时要么回到 Frame 重新出题要么回到 Graft 补漏——绝不糊弄过去。最终交付一份合成产物 一份简短合成记录写清基底、移植了谁的内容、拒绝了什么及原因、掉队者、验证结果。参赛模型与推理力度怎么配置默认参赛阵容定义在 models.jsonarena runners和arena cross-judge pool默认都是三模型面板opus / fable / sonnet不同家族保证观点多样性用/pstack:setup-pstackPi 用/skill:setup-pstack可改为账号实际可用的模型并为每个角色指定推理力度例如arena runners: opus xhigh, fable max力度等级为low / medium / high / xhigh / max详见 setup-pstack 说明Codex 上有自己的对应面板gpt-6-astra / gpt-6-sol / gpt-6-luna在 models.json 中同样可查。arena 和 swarm 有什么区别这两个技能长得像但用途不同arenaswarm任务形态N 个模型赛跑同一份交付物N 个工人切分覆盖或各自领任务核心动作交叉评审 → 选基底 → 移植亮点聚合所有结果 → 出统一报告产出一份合成产物 合成记录一张结果表 问题清单适合场景一次性生成会锁死错误形态的非平凡交付物并行覆盖测试、批量检查、多路探索简单说要一份更好的作品用 arena要更广的覆盖用 swarm。什么时候该用 arena✅ 适合跨模块的新功能设计、需要定型的 API/类型结构、多种设计方向并存的非平凡任务——一次尝试就可能锁死错误形态的场景。❌ 不适合改动一两行的小任务。pstack 的路由规则只对涉及设计决策、多文件改动或未知原因的问题才升级流程小任务直接做更划算。快速参考arena 技能完整定义models.json 模型与角色配置setup-pstack 模型角色配置技能参考文档命令表与运行时支持项目 README安装与上手一句话总结arena 把让模型重试几次升级为多模型赛跑 交叉评审 择优移植 统一验证的完整流水线——用一次可控的并行成本换掉一次难以回头的错误定型。【免费下载链接】pstack-claudeClaude Code, Codex, Copilot, Pi, OpenCode, Gemini, and Prime Agent versions of Potetos pstack. Rigorous agent workflows with Cursor primitives translated for other harnesses.项目地址: https://gitcode.com/GitHub_Trending/ps/pstack-claude创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考