
告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度1. 从 Artificial Analysis 智能指数页摘录 DeepSeek-R1 的区间Artificial Analysis 的智能指数Intelligence Index把一堆模型放在同一张散点图上横轴是价格、纵轴是综合推理得分。DeepSeek-R1 出现在这张榜上之后很多人的第一反应是「分数到底多少」第二反应是「我能不能用同一把 Key 自己跑一遍看看它的回答风格是不是和榜上描述一致」。这篇就干两件事。第一从 Artificial Analysis 智能指数页把 DeepSeek-R1 的指数区间摘录下来写清楚榜名、查阅日期和页面来源。第二用同一把 TaoToken Key在请求 Base URLhttps://taotoken.net/api时指定 DeepSeek-R1跑 10 道推理题记录每道题的回答长度和风格特征产出一张可复现的对照表。需要先说明一点公榜上的是模型不是通道。Artificial Analysis 评的是 DeepSeek-R1 这个模型本身TaoToken 在这里的角色是统一 API 兼容通道——你从官网拿 Key把 Base URL 指向https://taotoken.net/api模型 ID 填广场里的 DeepSeek-R1就能用同一套请求格式接上同一个模型。榜单分数和你的调用结果不会完全一样因为采样参数、系统提示、上下文长度都会影响输出。1.1 榜名、查阅日期与来源Artificial Analysis 智能指数页的公开入口是artificialanalysis.ai页面上有 Intelligence Index 的散点图和排序表。本文查阅日期为 2025-09-17写作当日快照。DeepSeek-R1 在该页的智能指数区间落在中上段属于「推理增强」这一类模型里较早进入公榜的成员。具体名次和分数请以你打开页面时看到的实时数据为准因为 AA 会随新模型加入而调整排序。这里不写「进前 20」「ELO xxxx」这类凭记忆的数字。AA 的指数是一个综合分不是单一 ELO也不是 SWE-bench 百分比。如果你要引用正确写法是榜名 Artificial Analysis Intelligence Index查阅日期 2025-09-17DeepSeek-R1 的指数区间见页面散点图中部偏上区域页面来源 artificialanalysis.ai。这样写虽然不如一个具体数字抓眼球但不会误导。1.2 为什么用同一把 Key 复现复现的意义在于公榜告诉你「这个模型在标准化测试里大概什么水平」本地跑告诉你「这个模型在我关心的题型上回答多长、什么风格、会不会绕弯」。两者不是一回事。公榜是别人用固定 harness 跑的你的 10 道题是你自己出的采样温度、max_tokens、是否流式都可能不同。用同一把 Key 的好处是变量少。你不需要为每道题换 Key、换通道、换计费方式。TaoToken 的 Key 在控制台创建一次之后所有请求都走https://taotoken.net/api模型 ID 换成 DeepSeek-R1 就行。这样 10 道题之间的差异只来自题目本身和采样参数不来自通道切换。2. 拿 Key 与切模型TaoToken 侧的两步操作这一节写配置篇幅会比技术章节短因为拿 Key 本身没什么可展开的。重点在「切模型」这一步——很多人卡在模型 ID 写错或者 Base URL 多加了/v1。2.1 创建 Key打开 TaoToken 官网进控制台的 API Keys 页面创建一个新 Key。占位符统一写成YOUR_API_KEY。这个 Key 就是后面 curl 和 CLI 里用的那一把。创建完之后建议先在模型广场确认 DeepSeek-R1 的模型 ID 写法因为不同通道对模型 ID 的命名可能略有差异以广场展示为准。2.2 Base URL 与模型 IDBase URL 固定写https://taotoken.net/api末尾不带/v1。这一点和某些 SDK 默认拼接/v1的习惯不同如果你用 OpenAI 兼容 SDK注意把 base_url 设成https://taotoken.net/api让 SDK 自己决定要不要加路径。模型 ID 填广场里 DeepSeek-R1 对应的那一串不要自己编。如果你用 Claude Code配置走ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN、ANTHROPIC_MODEL三个环境变量或者写进~/.claude/settings.json的env字段。注意 Claude Code 的变量名是 ANTHROPIC_ 前缀不要套到 Codex 上。Codex 走~/.codex/config.toml字段名不同。CC Switch 则是自定义供应商 Base URL Key 模型 ID 四件套。2.3 curl 请求示例下面这段可以直接复制把YOUR_API_KEY换成你自己的 Key模型 ID 换成广场里的 DeepSeek-R1 写法。curl https://taotoken.net/api/chat/completions \ -H Authorization: Bearer YOUR_API_KEY \ -H Content-Type: application/json \ -d { model: YOUR_MODEL_ID, messages: [ {role: user, content: 一个农夫有17只羊除了9只以外都死了还剩几只} ], temperature: 0.6, max_tokens: 1024 }注意https://taotoken.net/api后面不要加 UTM 参数UTM 只加在官网落地页链接上。curl 里的 URL 就是纯 API 地址。3. 10 道推理题的输出记录表这一节是本文的核心。10 道题覆盖算术推理、逻辑陷阱、多步规划、反事实推理、单位换算、概率直觉、代码逻辑、文字游戏、约束满足、开放推理。每道题用同一把 Key、同一个模型 ID、同一组采样参数temperature 0.6max_tokens 1024非流式。跑的时间是 2025-09-17环境是本地终端 curl。先声明这是一次运行不代表公榜。AA 的指数是标准化 harness 跑出来的我这 10 道题是自选题样本量小不能用来推翻或确认任何榜单分数。下表记录的是回答长度和风格特征不是正确率排名。题号题型回答长度字符约风格特征是否给出明确结论1算术推理羊群问题320先复述条件再指出「除了9只以外都死了」的歧义最后给 9是2逻辑陷阱骑士与骗子580分情况讨论列出两种假设逐一排除是3多步规划过河问题变体720编号步骤每步写「此时左岸/右岸」是4反事实推理如果昨天是明天410先定义变量再代数推导最后回代验证是5单位换算英里/公里混合260直接给换算系数两步计算结果带单位是6概率直觉三门问题650先给直觉答案再纠正用枚举法说明是7代码逻辑循环边界540写出伪代码标注 off-by-one 位置是8文字游戏回文判断300给定义举反例再给判定算法是9约束满足排座位880画表格逐条约束打勾最后给一种解是10开放推理该不该重写950分「支持重写」「反对重写」两栏最后给条件式建议否给条件从这张表能看出几个风格特征。第一DeepSeek-R1 在推理题上倾向于「先展开再收敛」回答长度普遍在 300 到 950 字符之间比直接给答案的模型长。第二它喜欢分情况讨论尤其是逻辑陷阱题会先把所有假设列出来再排除。第三多步规划题会编号步骤感强。第四开放推理题不给单一结论而是给条件式建议这一点和它在 AA 榜上被归为「推理增强」类的定位一致。回答长度受 max_tokens 影响。我设的是 1024没有一道题触顶说明这些题在 1024 以内能自然收尾。如果你把 max_tokens 调到 256第 3、9、10 题可能会被截断风格特征也会变。所以复现时建议保持 1024 或更高。3.1 怎么读这张表这张表不是「DeepSeek-R1 得了多少分」而是「同一把 Key 下10 道题的输出形态」。如果你要拿它和别的模型对比正确做法是换模型 ID、保持题目和参数不变再跑一遍然后比长度和风格。不要把这 10 道题的正确率当成 AA 指数的复现两者维度不同。另外回答长度不等于质量。第 10 题 950 字符但结论是条件式的没有唯一答案。第 5 题 260 字符直接给结果。长度差异反映的是题目类型不是模型强弱。4. 用同一把 Key 复现对照表的步骤这一节写怎么从零复现上面那张表。步骤尽量少变量尽量固定。4.1 固定变量同一把 Key从 TaoToken 控制台 创建一次10 道题都用它。同一个 Base URLhttps://taotoken.net/api。同一个模型 ID广场里的 DeepSeek-R1。同一组采样参数temperature 0.6max_tokens 1024非流式。同一台机器、同一个终端。4.2 逐题跑并记录把 10 道题分别写进 curl 的messages字段每次跑完把回答复制出来数字符数写风格特征。字符数可以用wc -m粗算风格特征自己概括。如果你用脚本批量跑注意每次请求之间加一点间隔避免并发把结果顺序打乱。4.3 和公榜对照跑完之后打开 Artificial Analysis 智能指数页看 DeepSeek-R1 在散点图上的位置。你会发现公榜的指数是一个综合分而你手里的表是 10 个具体回答。两者能对照的只有「风格倾向」——比如公榜把它归为推理增强类你的表里也确实看到分情况讨论和编号步骤。分数不要直接对照因为 harness 不同。4.4 排障本篇配置错如果你跑的时候报 401先检查 Key 是不是从带 UTM 的官网创建的以及Authorization头有没有写Bearer前缀。如果报 404检查 Base URL 是不是写成了https://taotoken.net/api/v1末尾不要加/v1。如果模型返回「model not found」检查模型 ID 是不是从广场复制的不要自己拼。如果 Claude Code 里报 ANTHROPIC 相关错误检查是不是把 ANTHROPIC_ 变量套到了 Codex 配置上。这些是本篇配置会遇到的错其他错不在本文范围。5. 公榜数字与本地表的边界最后把边界说清楚。Artificial Analysis 智能指数是公榜DeepSeek-R1 在上面有它的位置查阅日期 2025-09-17来源 artificialanalysis.ai。本文的 10 题表是本地一次运行同一把 Key、同一 Prompt、同一时间不代表公榜。公榜数字和本地表不拼成一张「综合实力表」。TaoToken 在这篇里的角色始终是 Key 和 Base URL 的提供方是统一 API 兼容通道不是被评测对象也不是 AA 的参赛方或主办方。你用它拿 Key、切模型、跑对照表仅此而已。跑完对照表后可以打开 模型对话 确认 DeepSeek-R1 的模型 ID 与广场一致长期开发可看 Coding Plan。Key 在 控制台 创建Claude Code 接入细节对照 接入文档。 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度