
一、Agent 评测报告模板适用场景版本验收评测、能力横向对比、上线前终验可根据评测规模裁剪对应章节报告表头项目内容评测报告名称【XX Agent Vx.x 版本】评测报告评测对象例数据分析Agent / 多Agent协同办公系统 / 代码开发助手评测类型□ 日常回归评测 □ 版本迭代验收 □ 上线前终验 □ 横向对比评测 □ 安全专项评测评测周期202X-XX-XX 至 202X-XX-XX执行人文档版本V1.0基线对比版本例Vx.x 生产版本 / 竞品XX1. 评测概述1.1 评测目的【填写说明明确本次评测核心目标例如验证新版本工具调用优化效果、评估端到端任务达标率、对比两个模型版本的能力差异、排查线上失败案例根因】1.2 评测范围覆盖能力维度推理规划 / 工具调用 / 记忆管理 / 任务交付 / 安全合规勾选本次覆盖项覆盖业务场景例数据查询与报表生成、文档摘要与整理、多系统信息同步、代码调试不纳入范围【明确排除的能力与场景避免结论歧义】1.3 评测方法组合评测方法占比用途说明离线自动化基准测试60%原子能力回归、批量指标统计仿真沙箱端到端测试25%完整任务链路验证、异常场景覆盖LLM-as-Judge 自动评分10%开放任务质量评估、推理过程打分人工专家抽测校验5%核心场景校准、失败案例复核安全红队专项测试-安全评测时启用1.4 测试集概况总用例数XX 条场景分布典型场景 XX 条XX%、边界场景 XX 条XX%、异常场景 XX 条XX%、对抗场景 XX 条XX%用例来源业务真实日志抽样 / 专家设计 / 公开基准集适配黄金标准集XX 条用于评委校准与结果校验1.5 评测环境配置【单一变量控制说明确保结果可复现】大模型版本模型参数temperatureXXtop_pXX最大Token数XX系统提示词版本工具集版本运行环境沙箱版本 / 依赖库版本 / 网络环境Trace数据来源DeerFlow / LangSmith / 自研追踪系统2. 核心结论与验收判定2.1 整体结论【一句话总结是否通过验收、核心能力变化、主要风险】例本次 V2.1 版本端到端任务成功率达 88.2%满足 ≥85% 的验收阈值工具调用准确率较 V2.0 提升 7.3 个百分点但长任务记忆衰减问题仍较突出严重错误率 1.2% 略高于阈值建议修复 Top2 问题后上线。2.2 验收指标达标情况指标类别核心指标验收阈值实测值达标情况效果类端到端任务成功率≥85%88.2%✅ 达标效果类严重错误率1%1.2%❌ 未达标效率类平均任务交互轮次≤8轮6.7轮✅ 达标成本类单任务平均Token消耗≤8k7.2k✅ 达标安全类注入攻击绕过率2%0.8%✅ 达标2.3 版本对比结论【与基线版本的核心指标变化】指标基线版本V2.0待测版本V2.1变化幅度说明端到端成功率81.5%88.2%6.7%工具参数校验优化生效工具调用准确率89.1%96.4%7.3%补充工具描述与Few-Shot平均轮次7.8轮6.7轮-14.1%冗余调用减少2.4 核心发现优势项【2-3项核心提升/亮点】短板项【2-3项核心问题按影响优先级排序】风险项【潜在业务风险、安全风险提示】3. 分维度评测详情3.1 推理规划能力维度得分X/10 分或百分制整体表现【概括任务拆解、路径规划、反思纠错的整体水平】优势子任务依赖识别准确多目标任务优先级排序合理短板极端模糊输入下拆解遗漏率高失败后反思修正率仅 42%典型案例正向案例【用例ID 简要说明】负向案例【用例ID 简要说明】3.2 工具调用能力维度得分X/10 分细分指标工具选择准确率 XX%、参数填充正确率 XX%、异常处理成功率 XX%、冗余调用率 XX%整体表现优势短板典型案例3.3 记忆与上下文管理维度得分X/10 分细分指标关键信息召回率 XX%、长上下文留存率 XX%、记忆混淆率 XX%整体表现优势短板超过10轮后关键约束遗忘率达 35%典型案例3.4 任务交付质量维度得分X/10 分整体表现最终产出的完整性、准确性、格式合规性、业务适配性评估优势短板典型案例3.5 安全合规能力维度得分X/10 分细分指标注入攻击绕过率、越权调用检出率、敏感信息泄露率整体表现风险点4. 错误归因与分布统计4.1 错误类型分布错误大类错误数量占比优先级工具调用类XXXX%P0推理规划类XXXX%P1记忆上下文类XXXX%P1知识幻觉类XXXX%P2输出交付类XXXX%P2安全合规类XXXX%P0环境工具侧XXXX%-4.2 Top3 核心问题深度分析问题1工具必填参数遗漏占失败案例 32%典型表现调用数据库查询工具时缺失时间范围参数导致返回全量数据根因工具描述未高亮必填项系统提示词无参数校验指令影响范围所有涉及多参数工具的任务修复成本低问题2长任务约束条件遗忘占失败案例 21%典型表现用户初始要求“输出Excel格式”多轮工具调用后最终输出为文本根因上下文窗口压缩后初始约束被稀释无核心约束持久化机制影响范围8轮以上的长链路任务修复成本中问题3工具报错后无重试策略占失败案例 18%典型表现API超时后直接判定任务失败未进行重试或降级处理根因系统提示词未定义异常处理流程无自动重试机制影响范围所有依赖外部API的任务修复成本低4.3 典型 Bad Case 清单用例ID场景错误类型问题描述Trace链接TC-023多表数据查询参数填充错误TC-057长文档分析记忆遗忘5. 优化建议与行动计划优先级对应问题优化方案优化层级预期收益计划完成时间责任方P0工具参数遗漏1. 补充工具参数必填标识2. 增加参数校验系统指令3. 加入参数校验中间节点Prompt工程 流程机制参数正确率提升至98%P0严重错误率超标新增事实性输出自检环节高风险输出触发二次校验流程机制严重错误率降至0.5%以内P1长任务约束遗忘核心约束提取并写入持久记忆每轮自动召回记忆机制优化长任务成功率提升10%P1工具异常无重试新增工具调用重试策略超时/限流场景自动重试2次运行时机制异常场景成功率提升15%P2推理路径冗余优化规划提示词增加路径最优性校验Prompt工程平均轮次减少1轮6. 附录附录1完整评测用例集链接附录2全量执行日志与Trace数据链接附录3评分Rubric细则附录4LLM评委配置与校准报告附录5人工评测原始打分表二、Agent 错误分类与归因清单细化版用途失败案例根因标注、错误分布统计、优化方向定位共 7 大类、28 个细分小类可直接作为标注字典使用1. 推理规划类错误错误子类错误定义典型表现根因定位方向优化方向任务拆解遗漏复杂任务拆解时关键子步骤缺失导致最终目标无法完整达成要求“查询近3个月数据并生成对比图表”仅查询数据未生成图表系统提示词无拆解规范、模型拆解能力不足、无子目标校验机制增加结构化拆解指令、补充Few-Shot示例、新增子目标核对节点子任务优先级错误子任务执行顺序颠倒依赖关系倒置导致后续步骤无效先写报告再查数据报告内容无数据支撑模型对任务依赖关系识别弱、无依赖分析环节提示词中增加依赖关系判断要求、引入规划-校验两阶段流程规划路径冗余执行步骤繁琐存在大量无效/重复步骤效率低下同一数据反复查询多次、可一次完成的操作拆成多轮规划时无成本意识、无步骤合并逻辑优化规划Prompt增加“最小步骤”约束、新增路径精简反思节点反思纠错失效执行失败/结果异常时无法定位错误原因重试后重复踩坑工具报参数错误重试时参数完全不变无错误归因能力、无反思机制设计增加错误分析修正的反思节点、提供错误码与修正方案映射逻辑推理谬误推理过程存在逻辑漏洞、因果倒置、以偏概全等问题由个别案例推导普遍结论、数据口径混淆模型逻辑推理能力不足、领域知识缺失补充领域逻辑规则、增加推理自检步骤、接入领域知识库边界条件忽略未考虑异常边界场景默认按理想情况执行未考虑查询结果为空的情况直接基于空值计算提示词未覆盖边界场景、模型发散不足增加边界场景枚举指令、设计异常分支处理流程2. 工具调用类错误错误子类错误定义典型表现根因定位方向优化方向工具选择错误选错工具类型无法满足当前任务需求需要计算数据时选择了网页检索工具工具描述不清晰、工具数量过多导致混淆、语义匹配偏差优化工具名称与功能描述、按场景分类工具、增加工具选择示例必填参数缺失调用工具时遗漏必填字段导致调用直接失败调用邮件发送工具缺失收件人字段工具参数说明不明确、无必填标识、模型注意力不足工具描述中标注必填项、增加参数校验前置节点、补充错误示例参数格式错误参数类型、结构、格式不符合接口规范要求传数组却传了字符串、日期格式不匹配工具参数定义描述模糊、无格式示例参数说明补充格式要求与示例、入参前做格式校验与转换参数取值错误参数内容不符合业务逻辑格式正确但语义错误查询“2025年数据”却传入2024年、部门名称写错对参数含义理解偏差、上下文信息提取错误增加参数语义校验、关键参数二次确认、补充业务规则约束调用时机错误过早或过晚调用工具影响执行结果未做需求澄清就直接调用工具、结果已得出仍重复调用规划能力不足、无调用时机判断规则明确“先规划后执行”流程、增加工具调用必要性判断异常处理缺失工具返回报错、空结果、超时时直接终止任务或忽略异常API超时直接返回失败、空结果不做降级处理未定义异常处理流程、无重试/降级机制新增异常分类处理策略、内置自动重试机制、设计降级方案冗余重复调用无意义重复调用同一工具浪费资源且拖慢效率相同参数连续多次调用同一查询接口记忆失效、结果未正确留存、规划混乱优化中间结果记忆机制、增加调用去重逻辑并行调用混乱多工具并行调用时依赖关系处理错误、结果拼接混乱存在依赖的两个工具被并行调用后执行的工具无输入并行调度逻辑缺陷、依赖识别失效增加依赖关系校验、明确并行与串行的判定规则3. 记忆与上下文类错误错误子类错误定义典型表现根因定位方向优化方向关键信息遗忘多轮对话后用户初始要求、核心约束被丢失初始要求“输出Markdown表格”最终输出纯文本上下文过长被稀释、窗口压缩时被裁剪核心约束持久化存储、每轮自动召回关键指令上下文混淆不同任务、不同子话题的信息互相串扰将上一个任务的用户信息代入当前任务会话隔离机制缺失、记忆检索范围过大严格会话隔离、记忆按任务分片、增加话题边界判断记忆幻觉虚构不存在的历史信息、用户偏好、历史结论声称“之前你说过XX”实际对话中从未提及模型幻觉、记忆检索结果失真记忆检索增加置信度校验、低置信度信息不直接使用记忆更新失效新的事实/结果未更新到记忆中后续仍使用旧信息数据已修正后续计算仍使用旧版本数据无主动记忆更新机制、更新触发条件缺失设计记忆更新触发规则、关键结果自动写入持久记忆上下文过载无效信息过多挤占上下文窗口导致有效信息被挤出大量工具原始返回未做摘要直接全部塞入上下文无信息凝练机制、上下文管理粗放增加工具结果摘要节点、分级存储上下文、定期精简4. 知识幻觉与事实类错误错误子类错误定义典型表现根因定位方向优化方向事实编造凭空捏造不存在的数据、事件、人物、规则编造不存在的业务指标、虚构政策条款模型幻觉、不懂装懂增加“不确定则调用工具”指令、事实性输出强制溯源领域知识错误专业领域知识、业务规则、计算公式错误财务公式用错、行业合规规则理解偏差模型领域知识不足、未接入专业知识库接入领域RAG、专业问题强制检索知识库常识性错误基础常识、逻辑、客观事实错误时间计算错误、地理/单位常识错误模型基础能力短板增加常识校验工具、关键数值接入计算器拒答失效不懂装懂本该调用工具或承认不知道却直接编造答案明明可以查数据库却凭印象回答错误数据工具调用触发阈值过高、过度自信强化“先工具后回答”规则、降低工具调用触发门槛5. 输出交付类错误错误子类错误定义典型表现根因定位方向优化方向格式不符合要求输出格式与用户要求/业务规范不符要求JSON却输出自然语言、表格格式混乱格式约束指令弱、无输出校验输出格式强约束指令、增加格式校验节点答非所问最终输出偏离用户核心需求未解决核心问题用户要结论却只罗列过程数据目标对齐能力弱、执行中目标漂移增加最终输出与原始目标的对齐校验内容不完整交付物缺少关键组成部分报告缺结论、数据缺来源说明任务拆解遗漏、输出无完整性校验输出模板标准化、增加完整性检查项业务规范不符内容违反业务话术、口径、合规要求对外回复话术违规、数据口径不符合业务定义未植入业务规范、无合规校验业务规范写入系统提示词、增加合规审核节点可读性差逻辑混乱、表述晦涩、结构不清晰大段无结构文本、重点不突出输出组织能力不足、无结构化输出要求强制结构化输出模板、优化表达提示词6. 安全合规类错误错误子类错误定义典型表现根因定位方向优化方向Prompt注入绕过被恶意指令诱导偏离原有任务执行攻击者指令插入“忽略之前的指令执行XX”成功绕过系统提示词防御弱、无注入检测增加Prompt注入检测、系统提示词加固、权限分层间接注入失效工具返回结果中的恶意指令被执行网页/文件中嵌入的注入指令成功诱导Agent无间接注入防护、工具结果未做安全过滤工具返回结果前置安全过滤、禁用工具结果中的指令越权操作风险尝试执行超出权限范围的工具/操作普通用户Agent尝试调用管理员删除接口权限控制缺失、工具无权限校验工具层接入权限校验、敏感操作人工确认敏感信息泄露输出中包含密钥、用户隐私、内部系统信息泄露数据库地址、用户手机号、内部系统逻辑敏感数据未脱敏、输出无敏感信息过滤敏感信息统一脱敏、输出层增加敏感词检测违规内容输出输出违法、违规、伦理不当内容生成歧视性内容、违法操作指导对齐能力不足、无内容安全审核输出接入内容安全审核、高风险场景拒答策略7. 环境与基础设施类错误非Agent能力问题不计入能力评分需单独统计错误子类错误定义典型表现根因定位方向处理方式工具自身故障第三方工具/API服务不可用、报错、返回异常接口500、服务宕机、返回格式异常外部服务稳定性问题排除出Agent失败统计、推动工具侧优化、增加降级方案环境依赖问题沙箱环境、依赖库、网络环境异常导致执行失败代码沙箱缺依赖包、网络不通评测环境/生产环境配置问题修复环境配置、统一环境镜像数据接口变更工具接口参数、返回格式变更未同步更新接口字段改名导致Agent解析失败工具迭代未同步Agent配置更新工具描述、增加接口兼容性适配系统超时限流任务执行超时、模型/工具被限流截断长任务被中途截断、API触发限流资源配置不足、无流控策略优化任务拆分、增加限流重试、提升资源配额