评测数据为什么会被「多次修改」?一套可复现的数据口径与留痕机制

发布时间:2026/9/14 23:34:22
评测数据为什么会被「多次修改」?一套可复现的数据口径与留痕机制 摘要2026 年 9 月OpenAI 发布 GPT-6 Astra 当天多项评测数据被反复修改引发“刷榜”质疑。本文从这次真实事件出发结合 Nature 2016 年的可复现性调查讲清楚“同一份评测出现多个版本”的根因并给出一套可落地的数据口径与留痕机制。开头直答评测数据被多次修改根因不是“造假”那么简单而是口径、环境和版本没有锁定。本文以 GPT-6 Astra 事件和 Nature 2016 调查为证据给出五要素口径 六步留痕机制的落地方案建议对照检查你自己的数据流程。GPT-6 Astra 事件里数据到底被改了什么结论根据 Fortune 2026 年 9 月 4 日的报道OpenAI 自发布 GPT-6 Astra 起多次修改博客中的评测基准数据其中部分修改让自家模型成绩更好、竞品成绩更低直到被公开质疑后才部分回调。这次事件的关键修改点我整理成了下面的对照表依据 Fortune 报道与国内 IT之家 2026 年 9 月 6 日转载整理指标首版数据中途修改当前/最终Astra 幻觉率4.2%降至 2%回到 4.2%GPT-5.6 Sol 幻觉率12.2%降至 9.4%回到 12.2%Anthropic Fable 5.1FrontierMath Tier4 v287.8%降至 78%回到 83%AstraARC-AGI-3预发布草稿98.6%—正式版 99.99%AstraARC-AGI-3标准工具框架63%同一模型换 harness 后成绩差异巨大斯坦福智能系统实验室与可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 在讨论中提出了“Benchmaxxing”现象通过反复调整测试条件、重新运行评测把分数刷到最好看。OpenAI 发言人则解释称模型检查点、测试框架和评测运行方式不同大多数评测结果本身就有几个百分点的波动修改是为了“代表模型可用性能的最佳估计”。可复现性问题不只是 AI 圈的事如果你觉得“数据改来改去”只是大模型厂商的问题那再看两个更早的真实数据Nature 2016 年调查BakerNature 期刊20161576 名受访研究者中超过 70% 尝试复现他人的实验但失败超过 50% 无法复现自己的实验约 90% 认为存在可复现性危机。开放科学协作项目Open Science CollaborationScience 期刊2015对 100 项心理学研究进行复现97% 的原始研究结果在统计上显著但复现后只有 36% 依然显著。结论“结果说改就改、复现不出来”不是 AI 圈的专利而是数据工作缺乏口径纪律和留痕机制的普遍后果。区别只在于科研里有论文约束商业发布里只有利益约束。一份可复现的评测结果要锁定五要素结论基准成绩从来不是一个数字而是一组“测量条件”的快照。任何一个条件变化数字都可能变。我在做数据分析时把评测结果拆成五个必须同时锁定的要素可复现评测结果需要锁定的五个要素要素要记录什么典型坑指标定义指标口径与计算公式只说“幻觉率”不说怎么判定幻觉数据版本模型检查点、数据集版本同一个模型名实际跑的是不同权重运行环境测试框架、推理配置温度、上下文、并发换框架重跑分数完全不同评测方式harness、工具集、是否允许调用工具标准 harness 与增强 harness 成绩差异巨大评分配置判定方式、采样方式、运行次数非确定性评分跑一次就算数GPT-6 Astra 事件里最典型的例子就是 ARC-AGI-3标准工具框架下 63%配备更强工具框架后可达 99.9%——同一个模型换评测方式成绩差三十多个百分点。不记录评测方式这个数字就完全无法比较。留痕机制怎么落地六步流程结论留痕的对象不是“结果数字”而是“测量条件”。每次评测自动生成一份 manifest包含全部参数与哈希才是可追溯的。数据留痕机制从变更到可追溯的六步流程步骤做什么产出物① 口径登记指标由谁定义、何时定义、计算公式是什么口径登记表② 变更申请任何口径/参数修改先说明原因与影响范围变更单③ 审计日志系统自动记录谁在何时改了什么audit 表不可篡改④ 数据快照变更前自动存档旧版本永远可恢复版本快照⑤ 版本发布带版本号与时间戳发布manifest.json⑥ 可追溯回溯任意历史版本可一键复现复现报告落实到工程上我建议每次评测跑完自动生成一份 manifest结构类似示意{ eval_id: eval_20260908_001, metric: hallucination_rate, version: v1.3.0, model: {name: gpt-6-astra, checkpoint: ckpt_20260820, hash: sha256:9f2c...}, dataset: {name: hallucination_bench, version: 2026.08, hash: sha256:4bd1...}, harness: {type: standard, tools: [], max_steps: 30}, runtime: {framework: eval-runner 2.1, temperature: 0, samples: 3, judge: llm-judge-v3}, result: {value: 0.042, ci: [0.038, 0.046]}, changed_from: v1.2.0, change_reason: 修正幻觉判定口径排除翻译性改写 }有了 manifest别人问“这个数字怎么来的”你可以直接给出完整条件链而不是一句“我们当时就是这么算的”。踩坑记录只留痕数字不留痕条件现象留痕系统建了但回溯时发现“当时到底用的哪个版本”无从考证。根因只记录了结果数字没记录口径参数。修复manifest 里强制包含模型、数据集、框架、harness、评分配置的全部参数与哈希缺一不可。经验留痕的对象是“测量条件”不是“结果数字”。数字会骗人条件链不会。边界不是所有修改都是坏事关键在透明Snorkel AI 负责基准评测研究的工程师 Vincent Sunn Chen 指出发布前几小时调整评测成绩并不罕见通常是发布流程的一部分真正的问题不是“改”而是改的时候说不说清楚改了什么评测条件。对内部团队你自己的评测也要有版本纪律否则跨版本对比、跨模型对比毫无意义——你连自己都复现不了怎么跟别人比较留痕机制解决的是“可追溯”不解决“谁说得对”口径统一之后剩下的就是业务判断。FAQQ1评测数据修改多少算正常波动AOpenAI 官方的说法是“几个百分点以内”。更准确的做法是每次评测跑多次给出置信区间而不是单点数字。Q2小团队有必要建这么重的留痕机制吗A不用一步到位。最小可行版 口径登记表 评测 manifest 审计日志三样就能覆盖 90% 的追溯需求。Q3LLM 评测非确定性很强怎么解决A固定 temperature、固定采样次数取均值、使用确定性评分优先、记录每次运行 seed——把非确定性变成“可复现的非确定性”。Q4历史版本太多存储成本怎么办A快照存差异diff而非全量manifest 只存参数与哈希成本很低。Q5别人改了数据我怎么发现A定期抓取公开评测页面做快照对比类似 Internet Archive 的做法或要求对方提供 manifest。发现不一致时用你的快照说话。总结评测数据被“多次修改”不可怕可怕的是改的时候没有条件记录、没有版本、没有留痕。把口径锁成五要素、把流程走成六步你的评测结果才真正可复现、可比较、可追溯——这也是数据从业者最值钱的职业素养。延伸阅读更多信息可以关注456数据数据来源说明GPT-6 Astra 评测数据修改事件Fortune 报道《OpenAI quietly boosts some of Astras evaluation metrics, and continues to change others post-launch》2026 年 9 月 4 日IT之家转载报道2026 年 9 月 6 日。文中幻觉率、FrontierMath、ARC-AGI-3 等具体数字均出自该报道。“Benchmaxxing”提法斯坦福大学 Anka Reuel 与 Mike Hardy 在 Fortune 报道中的评论Snorkel AI 工程师 Vincent Sunn Chen 关于发布前调整评测的评论亦出自该报道。可复现性调查Baker, M.《1,500 scientists lift the lid on reproducibility》Nature 期刊533 卷452-454 页2016 年受访研究者 1576 名。心理学复现研究Open Science Collaboration《Estimating the reproducibility of psychological science》Science 期刊349 卷aac47162015 年。文中 manifest 为示意结构用于说明留痕字段设计。