RightModel工作坊教程:在cwc-workshops中用SKILL审计并扫描LLM评测套件

发布时间:2026/9/18 6:13:11
RightModel工作坊教程:在cwc-workshops中用SKILL审计并扫描LLM评测套件 RightModel工作坊教程在cwc-workshops中用SKILL审计并扫描LLM评测套件【免费下载链接】cwc-workshops项目地址: https://gitcode.com/GitHub_Trending/cw/cwc-workshops本文带你完成 cwc-workshops 仓库中 RightModelPicking the Right Model工作坊的完整流程用 Claude Code 的 SKILL 能力先对 LLM 评测套件做一次可靠性审计再执行模型 × 推理参数扫描sweep找出性价比最高、速度最快的配置组合。整套方法框架无关学完就能搬去自己的评测项目上。一、RightModel 工作坊解决什么问题 很多团队都有这样一个困惑我的任务到底该用哪个模型要不要开 extended thinkingeffort 调到多高凭感觉选模型往往要么多花钱要么慢了不止一个数量级。RightModel 工作坊的答案是不要猜去测。但直接测也不行——评测本身可能有 bug在坏评测上跑扫描只会放大错误结论。因此工作坊把流程拆成两个阶段阶段目标产出阶段 1审计Audit检查评测套件是否可信一份带证据的问题清单阶段 2扫描Sweep在模型 × thinking × effort网格上跑评测3 张对比图 一句话推荐两个阶段相互独立可以只审计、只扫描或者两者都做建议先审计。二、工作坊材料一览 所有材料集中在 rightmodel/ 目录下结构如下入口说明rightmodel/README.md —— 两个阶段的定位、上手方式与运行要求兜底评测安装指南rightmodel/TAU_BENCH_SETUP.md —— 手把手装好 tau2-bench 并跑通冒烟测试SKILL 入口rightmodel/.claude/skills/eval-audit-and-sweep/SKILL.md —— 定义技能触发条件与执行流程审计清单rightmodel/.claude/skills/eval-audit-and-sweep/references/audit.md扫描方法rightmodel/.claude/skills/eval-audit-and-sweep/references/sweep.mdtau2-bench 专属配套rightmodel/.claude/skills/eval-audit-and-sweep/references/tau2-bench.md SKILL 只包含指导原则和示例代码片段不附带可运行脚本——因为每个评测框架的结构都不同。Claude 会读取你的评测代码按清单里的原则为这套代码量身写胶水代码。运行要求很轻Claude Code 一个ANTHROPIC_API_KEY如果走无自有评测路线下文路线 B再加 Python 3.12/3.13 和git。三、阶段 1用 SKILL 审计 LLM 评测套件 审计听起来吓人其实它就是一张体检清单。audit.md 把常见问题分成四大块每块都是一组可以直接照做的检查项3.1 任务设计题目本身对吗成功标准是否无歧义两位专家看到同一个模型输出会不会对过/不过产生分歧答案有没有泄漏参考答案是否出现在提示词、few-shot 示例、甚至 agent 能读到的文件里能不能靠记忆答题题目若涉及真实实体模型不干活也能答对那就没测到目标技能难度是否来自问题本身只是措辞晦涩的伪难题测的是读题能力不是目标能力覆盖是否双向只测该搜索时搜索、不测不该搜索时不搜索会诱导单侧优化任务集很大时不必逐条人肉读清单给出了三层打法全量程序化检查重复率、标签分布、坏行→ 分层抽样精读 20~50 条 → 超过几百条时逐条跑一个廉价的LLM 审计器并聚合结论。3.2 框架harness设计脚手架干净吗核心风险是**混淆conflation**——把基础设施问题记到模型头上每个 trial 是否从全新环境开始没有残留文件、数据库行或缓存超时、限流、输出截断等基础设施失败是否与模型答错分开记录没答出来和明确回答否是否被混成同一个标签token / 上下文上限会不会把长答案截断成错误答案是否保存了完整的逐任务轨迹出了意外结果transcript 才是判断模型的锅还是评测的锅的唯一依据3.3 指标卫生成本和延迟测对了吗token 数要从 API 响应的 usage 里读别用字符串长度估算——误差大到足以反转成本排序TTFT/TTLT 要排除重试退避、排队等待这些测试台自己的行为多轮 agent 任务要按每次模型调用、每次工具调用分别记账否则分不清是模型慢还是工具慢3.4 评分器设计打分公平吗提示词与评分器是否一致题目说达到阈值 X评分器却要求严格大于 X就是惩罚听话的模型精确匹配评分器要不要做归一化空格、大小写、4vs4.0太严会把正确答案判错太松会放过错误答案如果评分器本身是LLM judge重点防四种偏见位置偏差A/B 顺序要随机化、冗长偏差、自我偏好judge 和被测模型同家族、对参考答案标签的盲从最后一步是报告清单明确要求把发现写成观察 建议而非你错了区分会让数字方向性出错的严重问题与只增加噪声的小问题并引用具体文件和任务 ID 作为证据。把 SKILL 装好后在评测仓库里粘贴一句话就能启动Use the eval-audit-and-sweep skill to audit this eval suite. Walk through task design, harness design, metrics hygiene, and grader design, cite specific files and task IDs, and offer to fix anything small you find.四、阶段 2模型 × 参数扫描锁定最佳配置 审计通过后进入 sweep.md 描述的扫描流程。目标是回答一个问题对于这个任务哪个模型, 参数单元格的每美元质量和每秒质量最优答案几乎从不是最大的模型 全开。4.1 怎么定扫描网格以工作坊默认网格为例三个模型家族的最新版本 × 两个推理旋钮维度取值说明模型Haiku 4.5 / Sonnet 4.6 / Opus 4.7每个家族取最新thinking关 / 开是否启用扩展思考块effortlow / medium / high模型投入程度的行为信号trials3每个单元格独立重复 3 次取平均注意两点Haiku 没有 effort 参数、且不支持 adaptive所以它的开单元格用固定 4096 budget 表示网格是全交叉积SKILL 明确写了不要让用户削减网格。4.2 每个单元格记什么数每个单元格, 示例对至少捕获是否通过、输入/输出 token、agent 生成耗时。然后按单元格聚合出 5 个数其中最重要的是两个把质量和效率折成一个数的指标cost_per_success总成本 ÷ 通过数 —— 便宜 3 倍但通过率减半的模型其实并不便宜seconds_per_success总生成时间 ÷ 通过数4.3 产出三张图 一句话结论扫描结束要输出三张风格统一的 PNG通过率 vs 每任务平均输出 token / 成本 / 时延编码规则是颜色 模型、线型 thinking、标记大小 effort。再附上一个自包含的sweep_report.html数据表 base64 内嵌图浏览器直接打开就能分享。最后用一两句话下结论而不是甩一张表例如Sonnet 4.6 effortmediumthinking 关达到与 Opus 相同的 94% 通过率成本约为其 1/3延迟一半。只有当 Opus 多解出的那 6% 恰好是高价值题时才值得上 Opus。同时必须标注噪声下限n20 的评测里单个任务就是 5 个百分点比这更小的差异通常没有意义。五、动手路线两条路任选 路线 A你已经有自己的评测把.claude/skills/eval-audit-and-sweep/目录复制进评测仓库或从这个目录启动 Claude Code 用--add-dir挂上去粘贴Use the eval-audit-and-sweep skill on this repo. Skip the audit and go straight to the sweep. Find the eval entrypoint, patch in the thinking and effort knobs, confirm the model list and trial count with me, then run the full grid and generate the plots.多数第三方评测 CLI 只暴露--modelSKILL 会指导 Claude 找到框架里唯一调用 LLM 的位置grepcompletion(或client.messages加几行从环境变量读 thinking/effort 的合并逻辑——补丁只动 agent 侧调用不动 judge 和用户模拟器。路线 B手头没有评测用 tau2-bench 当替身Sierra 的开源 agent 基准tau2-benchairline 域是工作坊指定的替补agent 与模拟用户多轮对话、调用领域工具查订票、改航班、退款按最终数据库状态是否达标判 pass/fail。20 题切片每个模型大约 5~10 分钟。按 TAU_BENCH_SETUP.md 的四步走安装新建 venv →pip install -e .Python 3.13 用户额外装audioop-lts3.13 移除了标准库 audioop不装每次运行都会崩配置 API key写入.env的ANTHROPIC_API_KEY冒烟测试跑 1 个任务 × 1 次试验看到Agent Performance Metrics面板即成功1~2 分钟无输出属正常别以为卡死了跑扫描cd tau2-bench后粘贴 Use the eval-audit-and-sweep skill. Skip the audit for now and do a sweep for this eval (taubench airline).tau2-bench 配套文件 tau2-bench.md 让 Claude 直接知道用哪 20 个按难度分层的任务 ID、llm_agent.py的哪个函数要打补丁、从results.json的哪些字段读 pass rate /agent_cost/ 生成时间——你只需确认模型清单和试验次数。⚠️ 几个新手容易踩的坑均来自 TAU_BENCH_SETUP.md 的实战经验不要tail -f results.json看进度——该文件一开始就是空列表跑完才写入用uv就全程用uv run别和pip混用否则装错环境后台跑扫描时等待进程真正退出pgrep确认消失再读结果如果希望在本机获得完整材料可执行git clone https://gitcode.com/GitHub_Trending/cw/cwc-workshops六、带走这三条原则 ✅先审计后扫描在坏评测上跑得越快错得越快最惊艳的评测结果往往是评测自己的 bug成本看每次成功单价、单次延迟都是中间量cost_per_success与seconds_per_success才是决策量把评测当测试套件养生产中发现的新失败模式补成新题、饱和题退役加固、评分器漂移就重新校准——审计不是门禁是这个循环的起点完成这套流程后你手里将有一份可信的评测体检报告、三张可直接放进汇报的对比图以及一句能直接执行的选型结论。【免费下载链接】cwc-workshops项目地址: https://gitcode.com/GitHub_Trending/cw/cwc-workshops创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考