
如何搭建自己的模型排行榜基于Superhuman数据的完整实战【免费下载链接】superhuman项目地址: https://gitcode.com/GitHub_Trending/sup/superhumansuperhuman仓库是 Google DeepMind Superhuman Reasoning 团队开源的数学评测数据集包含 IMO-Bench 基准题库、1000 条人类评分样本和海量 Lean 形式化证明。本文就用这套真实数据带你一步步搭建自己的AI 模型排行榜从获取数据集、批量跑模型到自动评分和生成榜单图表全程只需要一台笔记本和一个模型 API Key无需任何 GPU 集群。一、为什么用 Superhuman 数据搭排行榜自建模型排行榜Model Leaderboard的核心是一套难度足够、可自动评分、有参考解答的题库。superhuman 仓库恰好三件套齐全目录内容在排行榜中的作用imobench/4 份 CSV 基准数据集400 题 60 题 1000 条评分排行榜核心题库与评分标准leap/Lean 4 形式化证明Putnam 2025 全 12 题等可验证的硬核榜单数据aletheia/研究型数学问题解法与论文参考解答与进阶素材先把仓库克隆到本地git clone https://gitcode.com/GitHub_Trending/sup/superhuman二、获取数据先认识 4 份核心 CSV排行榜搭建前建议先花 10 分钟读懂数据。四份数据集分工明确数据集文件题量特点IMO-AnswerBenchimobench/answerbench_v2.csv400 题短答题可程序精确比对最适合榜单IMO-ProofBenchimobench/proofbench_v2.csv60 题证明题附带评分细则Grading guidelinesIMO-GradingBenchimobench/gradingbench.csv1000 条人类评分样本用于校准自动评分器IMO-LeanProofBenchimobench/lean_proof_bench.csv60 题题目已形式化为 Lean 4机器可判定对错⚠️注意版本imobench/README.md 明确说明answerbench_v2.csv和proofbench_v2.csv修复了旧版的歧义题与笔误旧版已弃用——搭榜时务必用 v2否则排名结果会和官方榜单对不上。题目覆盖代数、几何、组合、数论四大板块细分类别分布参考下图三、实战第 1 步批量跑模型、收集作答AnswerBench 每行包含 6 个字段Problem ID题号、Problem题目、Short Answer标准答案、Category/Subcategory分类、Source来源赛事。流程很简单读 CSV → 把题目喂给模型 → 把回答按题号落盘。用 Python 的csv模块几行就能搞定import csv with open(imobench/answerbench_v2.csv, encodingutf-8) as f: rows list(csv.DictReader(f)) # 400 道短答题 for row in rows: answer call_model_api(row[Problem]) # 换成你的模型 API 调用 save(row[Problem ID], row[Category], answer)三个让榜单更有说服力的细节统一提示词所有模型用完全相同的 prompt 与参数这是排行榜公平性的前提记录元信息模型版本、推理参数、运行日期都写进结果文件保证榜单可复现短答归一化提交前把$3$、3、(3)这类格式差异统一能避免大量格式性失分。四、实战第 2 步自动评分与人工校准评分是排行榜最容易翻车的一环分两条线短答题AnswerBench答案归一化后直接精确匹配Short Answer字段即可零成本、零歧义。证明题ProofBenchCSV 中每题都附Grading guidelines评分细则Partial / Almost / Correct 分档标准用 LLM 对照细则打部分分。此时 imobench/gradingbench.csv 派上大用场——它提供 1000 条(题目, 作答, 人类给分 Points, 奖励分 Reward)样本正好用来验证你的自动评分器和人类评委是否同频。官方团队正是用这 1000 条数据测得自动评分与人类评分呈强正相关评分按难度分布也很关键简单题正确率集中在 6 成以上难题则不足 1 成——你的自动评分器必须在三个难度档上都能稳定输出榜单才有区分度五、实战第 3 步汇总得分、生成排行榜图表最后一步按模型 × 类别汇总正确率。accuracy correct_count / total # 每个模型、每个类别各算一次把结果画成分组柱状图就是你的第一版模型排行榜。下面两张图正是基于这份数据画出的官方榜单样式可以直接作为可视化模板 解读榜单时别只看总分从 AnswerBench 榜能看到组合题是所有模型的共同短板而 ProofBench-Advanced 上最强模型也只有约六成正确率——子类别维度往往比总分更能暴露模型的真实能力边界。六、进阶玩法给排行榜加上形式化验证维度想让榜单更硬核可以引入 leap/ 目录的形式化证明数据——LEAP 框架用 Lean 4 编译器验证证明编译通过即机器级正确彻底消除评分争议Putnam-2025/2025 年 Putnam 竞赛全部 12 题的 Lean 4 完整证明100% 解出率例如 putnam_2025_a1_solution.leanLEAN-IMO-Bench/Basic/ 与 LEAN-IMO-Bench/Advanced/分难度的形式化解题示例可对照 imobench/lean_proof_bench.csv 中的 Lean 题面使用Open-Problems/Erdős 问题 457 等开放问题的已验证证明属于榜单的天花板素材。搭榜思路以lean_proof_bench.csv的题面为输入跑各模型生成形式化证明再用 Lean 编译器编译判定通过/未通过——排行榜上的每一个 1 都是编译器盖章的说服力拉满。七、常见坑与最佳实践清单⚠️只用 v2 版数据集旧版answerbench.csv/proofbench.csv已弃用用错版本会让排名整体失真⚠️大文件流式读取gradingbench.csv有 18 万多行用csv.reader逐行流式处理别一次性read()全文✅评分细则照抄ProofBench 的Grading guidelines就是标准答案评分 prompt 中逐条引用避免自由发挥✅榜单即文档结果文件里记录模型版本 参数 日期 数据版本四元组别人才能复现你的排名。 总结一下题库选 AnswerBench/ProofBench v2、评分用 GradingBench 校准、进阶用 Lean 形式化验证——这三步走完你就拥有了一个数据扎实、可复现、有区分度的模型排行榜。全部原始数据在 imobench/形式化解题结果在 leap/动手试试吧【免费下载链接】superhuman项目地址: https://gitcode.com/GitHub_Trending/sup/superhuman创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考