
agents-cli eval generate grade 两步走自定义 trace 路径高级用法指南【免费下载链接】agents-cliThe CLI and skills that turn any coding assistant into an expert at creating, evaluating, and deploying AI agents on Google Cloud.项目地址: https://gitcode.com/GitHub_Trending/ag/agents-cli本文带你掌握agents-cli 评估命令的核心进阶玩法用eval generate生成 Agent 执行 trace完整轨迹再用eval grade对 trace 打分。相比一条命令跑完的eval run两步走模式让你可以把 trace 写到自定义路径、复用已有 trace 反复重新评分是 AI Agent 评测调试中非常实用的高级用法新手也能快速上手。为什么要把评估拆成两步走在脚手架生成的 Agent 项目里通常推荐先跑一键式的agents-cli eval run——它会在内部串联generate跑推理 grade打分两步一步出分。但以下场景就需要把两步拆开 希望把 trace 文件保存到自己指定的目录比如纳入版本管理 修改了评分指标metrics后不想重新跑一遍 Agent只想用旧 trace 重新打分 你的 trace 不是eval generate生成的例如来自eval dataset synthesize或手工整理只需单独评分。两步走模式的本质generate 只负责跑 Agent 拿轨迹grade 只负责拿轨迹打分两者通过 trace 文件解耦。相关设计可以在 docs/src/guide/evaluation.md 中找到官方说明。三步走先理解项目的默认 trace 路径agents-cli的评估产物遵循一套固定的目录约定定义在 src/google/agents/cli/eval/_paths.py阶段含义默认位置阶段 1待推理的评估数据集tests/eval/datasets/*.json阶段 2填充好的 trace 文件Agent 回复 工具调用artifacts/traces/traces_时间戳.json阶段 3打分结果artifacts/grade_results/其中阶段 2 的 trace 文件就是本次主角它是一个 JSON 文件包含每个评估用例eval case里 Agent 的完整响应与function_call/function_response事件。第一步用 eval generate 生成自定义路径的 traceeval generate会读取数据集逐条把用例发给 Agent默认在本地起 HTTP 服务或用--url指向已部署的 Agent并行执行后把填充好的 trace 写到--output指定的位置# 把 trace 写到自定义目录 custom_traces/ agents-cli eval generate \ --dataset tests/eval/datasets/custom-dataset.json \ --output custom_traces/两个实用细节--output传入目录时会自动在里面生成带时间戳的traces_时间戳.json多次运行互不覆盖不传--dataset时默认使用项目自带的 tests/eval/datasets/basic-dataset.json 示例数据集。参数细节可查阅 src/google/agents/cli/eval/cmd_generate.py。第二步用 eval grade 对 trace 重新评分eval grade接受单个 trace 文件或一个目录目录下所有*.json会被合并评分再按内置指标或自定义指标打分# 从自定义目录读 trace指定指标评分 agents-cli eval grade --metrics general_quality --traces custom_traces/几个常用选项完整定义见 src/google/agents/cli/eval/cmd_grade.py--tracestrace 文件或目录省略时默认扫描artifacts/traces/--metrics逗号分隔的内置指标如final_response_quality,grounding--config指定tests/eval/eval_config.yaml之类的指标配置文件默认路径即此处--output评分结果目录默认写入artifacts/grade_results/。评分结果会同时输出带时间戳的results_时间戳.json和可直接在浏览器打开的.html报告并支持后续用agents-cli eval compare对比两次结果验证改动是否真的有效。三大典型场景自定义 trace 路径的用武之地场景一trace 入库管理把 trace 输出到--output my_traces/这类可提交的目录团队可以共享同一批 trace、统一评分口径。场景二改指标不重跑换了一版 LLM-judge 提示词或自定义custom_function后直接对旧 trace 目录重新eval grade即可省去重复调用 Agent 的时间和费用。这正是两步走最大的省钱点。场景三接入 CI 流水线trace 文件可作为流水线的中间产物存档评分步骤与推理步骤分离触发失败时也能只重放评分环节快速定位问题小结两步走的核心价值eval generate 跑 Agent产出填充好的 traceeval grade 读 trace产出评分结果两者靠--output/--traces参数解耦trace 可存任意路径、可反复复用日常快速验证仍推荐agents-cli eval run需要自定义 trace 路径或重新评分时再切换到两步走模式。更多评估技巧数据集合成、多轮指标选择、eval-fix 循环可参考 skills/google-agents-cli-eval/SKILL.md 与 docs/src/guide/evaluation.md。【免费下载链接】agents-cliThe CLI and skills that turn any coding assistant into an expert at creating, evaluating, and deploying AI agents on Google Cloud.项目地址: https://gitcode.com/GitHub_Trending/ag/agents-cli创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考