Cloudflare 开了 Disallow AI Training,谁还在用 TaoToken Key 消耗 Token?

发布时间:2026/9/18 2:08:29
Cloudflare 开了 Disallow AI Training,谁还在用 TaoToken Key 消耗 Token? 1. Cloudflare Disallow AI Training 打开后用 TaoToken Key 反查“谁在消耗 Token”Cloudflare 上线 Disallow AI Training 设置后内容站常见的动作是去 robots.txt 补规则或者在 WAF 里屏蔽一批 UA。但如果你的站点后端同时在用 TaoToken 做模型对话、代码助手或内部脚本问题会变成两层Cloudflare 层拦的是“抓网页内容去训练”的爬虫TaoToken 层消耗的是“带着 Key 调用模型 API”的客户端。如果还未获取 Key先到 TaoToken 官网 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_contentcf_disallow_intro 创建然后把客户端 Base URL 改成 https://taotoken.net/api。本文按内容站后端/运维视角给一套可复现排查从 Cloudflare 日志和自身网关 access.log 入手按 UA、路径、脱敏 Key 前缀做 grep 对照输出搜索收录爬虫、AI 训练爬虫、自有业务脚本三类清单再补 WAF/robots.txt 规则与一次带 Key 的回归请求记录。先厘清边界。Cloudflare 这个开关解决的是“混合用途爬虫”问题既想做搜索收录又想把内容用于 AI 训练。Apple、Google、Microsoft 已承诺遵守该设置但这不自动等于你站内所有 AI 接口调用都会停止。你的业务脚本、CI、Claude Code、Codex、定时摘要任务、第三方面板只要还拿着有效 Key就会继续消耗 Token。因此排查目标不是“Cloudflare 是否生效”一句话而是“Cloudflare 日志里的抓取行为”和“API 网关日志里的 Key 使用行为”能否对上。Cloudflare 日志看 ClientRequestUserAgent、ClientRequestPath、ClientIP、RayID。网关 access.log看 UA、请求路径、Authorization/x-api-key 的脱敏前缀、状态码、耗时。TaoToken Key不要在日志里完整打印只落前 6~8 位或哈希后 8 位Base URL 固定为https://taotoken.net/api。如果你现在还没有把工具切到 TaoToken建议先完成最小接入再做审计。原因很简单没有一个统一 Base URL 和 Key 前缀你无法判断消耗来自 Claude Code、Codex、CC Switch 还是某个历史脚本。接入动作见下一节。2. 基线接入Claude Code、Codex、CC Switch 三件套都指向 https://taotoken.net/api要让后面的日志审计有意义先让客户端“身份可辨”。第一步在 TaoToken 官网 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_contentkey_onboarding 创建 Key控制台里给 Key 起一个可读名字例如cf-audit-claude-code、cf-audit-codex-ci、cf-audit-cron-summary。不要所有工具共用一个无备注 Key否则 access.log 里只能看到同一个前缀排查会退化成猜。第二步把各客户端 Base URL 改为https://taotoken.net/api。注意这里不加 UTM工具配置里只填 API 根地址。Claude Code 的 settings.json 示例Claude Code 侧使用settings.json与环境变量ANTHROPIC_*。在用户目录下编辑或新建~/.claude/settings.json填入自己的 Key 占位符YOUR_API_KEY{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_AUTH_TOKEN: YOUR_API_KEY, ANTHROPIC_API_KEY: YOUR_API_KEY } }如果团队使用项目级配置可放在项目.claude/settings.json中但不要把真实 Key 提交到 Git。更稳妥的方式是把 Key 放在本地环境变量settings.json 只留 Base URL 和变量引用。改完后重启 Claude Code让它重新加载配置。验证时不要只看界面能否聊天要看请求是否落到你的网关日志路径通常会出现/v1/messages或兼容路径UA 会带 Claude Code 相关标识。Codex 的 config.toml 示例Codex 侧不要套用ANTHROPIC_*它使用config.toml。典型位置是~/.codex/config.toml。下面示例把 provider 指到 TaoToken并通过环境变量读取 Key# ~/.codex/config.toml model_provider taotoken model 你的模型名 [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY然后在 shell 中设置export TAOTOKEN_API_KEYYOUR_API_KEY如果你的 Codex 版本要求显式声明 wire API请按 TaoToken 文档和本地版本说明补齐关键是base_url必须指向https://taotoken.net/api环境变量不要写成 Anthropic 那套。配置完成后运行一次普通对话确认 Codex 发出的请求能在网关日志中按你的 Key 前缀找到。CC Switch 三件套怎么填CC Switch 更适合管理多套客户端配置。把它理解为三件套Provider、Base URL、API Key/模型。新增一个 Provider 时Provider 名称TaoToken-cf-audit。Base URLhttps://taotoken.net/api。API KeyYOUR_API_KEY。模型映射按你实际订阅或控制台可见的模型选择不要从旧笔记里硬编码未知模型名。保存后在 CC Switch 里切换一次回到终端启动 Claude Code 或 Codex观察是否还有请求走旧地址。很多“开了 Cloudflare 还在消耗 Token”的案例最后发现是 CC Switch 里残留了旧 Provider或者某个项目目录覆盖了全局配置。三件套梳理清楚后面的日志对照才有唯一标识。3. 在 Cloudflare 日志与 access.log 里做 UA、路径、脱敏 Key 前缀三路对照现在进入排查核心。你需要两份日志Cloudflare 侧Logpush、Logpull 或控制台日志和自身网关侧Nginx/OpenResty/Traefik/Kong 等 access.log。不要在日志里输出完整 Key如果网关暂时无法改格式先临时采样再立刻改成脱敏。建议在本地或受控日志节点执行下面的命令不要直接在生产库或核心节点跑重查询。3.1 先在网关日志里抽出脱敏 Key 前缀假设你的 access.log 中 Authorization 为Bearer YOUR_API_KEY或 Anthropic 风格为x-api-key: YOUR_API_KEY。如果日志记录的是完整 Header先用字段切割只保留前 8 位。Nginx 侧可以用 map 或 Lua 生成$taotoken_key_prefix。排查历史日志时可以用 grep/sed 临时提取# 本地抽样不要把输出贴到公开渠道 grep -Eo Bearer [A-Za-z0-9_-]{8} /var/log/nginx/access.log \ | sed s/Bearer // \ | sort | uniq -c | sort -nr | head -20如果使用的是x-api-keygrep -Eo x-api-key: [A-Za-z0-9_-]{8} /var/log/nginx/access.log \ | sed s/x-api-key: // \ | sort | uniq -c | sort -nr | head -20得到的结果不是完整 Key而是前缀频次。把前缀与 TaoToken 控制台里的 Key 名称对应起来哪个前缀属于 Claude Code、哪个属于 Codex、哪个属于 CI、哪个属于早已离职同事的脚本。找不到对应关系的 Key优先按泄露处理。3.2 按路径区分“网页抓取”和“模型 API 调用”Cloudflare 日志里的路径通常是你的站点资源例如/article/、/blog/、/wp-content/。模型 API 调用路径通常在 TaoToken Base URL 之后例如/v1/chat/completions、/v1/messages、/v1/responses、/models。两类日志不要混在一起看。Cloudflare Logpush 如果是 JSON可用 jq 筛选路径和 UAzcat cf-logpush.log.gz \ | jq -r select(.ClientRequestPath|test(/(article|blog|docs|wp-content)/)) | [.ClientRequestUserAgent, .ClientRequestPath, .ClientIP] | tsv \ | sort | uniq -c | sort -nr | head -50网关侧筛模型路径grep -E /(v1/messages|v1/chat/completions|v1/responses|models) /var/log/nginx/access.log \ | awk {print $1, $6, $7, $12} \ | sort | uniq -c | sort -nr | head -50注意Cloudflare 层看到的是访问你站点的爬虫网关层看到的是调用 TaoToken 兼容接口的客户端。一个爬虫不可能因为 Cloudflare 禁止 AI 训练就停止你的内部 CI 调用。反之网关里出现高频 Key 消耗也不代表网页正在被抓。三路对照就是把这个混淆拆开。3.3 按 UA 分类搜索收录、AI 训练、自有业务脚本UA 不是唯一证据但足够做第一轮分桶。搜索收录类常见 Googlebot、Bingbot、Applebot、DuckDuckBot 等AI 训练类常见 GPTBot、CCBot、Google-Extended、Applebot-Extended、Bytespider 等。Cloudflare 的新设置重点处理混合用途爬虫Apple、Google、Microsoft 承诺遵守但实际日志里仍会有伪装 UA。对于自称 Googlebot/Bingbot/Applebot 的请求最好做正向 DNS 验证而不是只看字符串。在网关侧自有业务脚本的 UA 往往长这样curl/8.x、python-requests/2.x、node-fetch、Go-http-client、okhttp或者 Claude Code/Codex 自己的 UA。它们与搜索爬虫的差异是带 Key、访问模型路径、有固定时间规律。把 UA、路径、Key 前缀三个维度合起来可以输出下面三类清单。清单 A搜索收录爬虫特征访问文章页、sitemap、robots.txtUA 为可验证的搜索引擎 bot无 TaoToken Key状态码以 200/304 为主。动作保留放行robots.txt 允许搜索收录不要因为 Cloudflare AI 训练开关误伤。核对正向 DNS 验证 Googlebot/Bingbot/Applebot检查 Cloudflare 的已验证 bot 标记。清单 BAI 训练爬虫特征高频抓取正文、分页、PDF、JSON 数据UA 命中 GPTBot、CCBot、Google-Extended、Applebot-Extended、Bytespider 等无 Key可能忽略 robots.txt。动作robots.txt 声明禁止训练用途WAF 对未验证 UA 和异常频率做 challenge/block保留 Cloudflare Disallow AI Training 设置。注意不要把 Google-Extended 和 Googlebot 混为一谈前者是训练用途控制后者是搜索收录。清单 C自有业务脚本特征带 TaoToken Key 前缀访问/v1/messages、/v1/chat/completions、/v1/responsesUA 为 curl/python/node/Claude Code/Codex有 cron 周期或 CI 触发。动作给 Key 命名、轮换无主 Key、按项目限流把 Base URL 统一到https://taotoken.net/api在 TaoToken 控制台查看 Key 维度的用量。核对用一次带 Key 的回归请求确认日志字段完整见下一节。4. 规则修正robots.txt、WAF 与 Key 限流各管一层三类清单出来后规则不要混写。robots.txt 管“声明”WAF 管“入口”Key 限流管“API 消耗”。Cloudflare Disallow AI Training 解决的是平台侧声明与执行但自有脚本的 Token 消耗必须回到 Key 治理。4.1 robots.txt 示例训练用途与搜索收录分开写下面只是常见写法按你的实际 UA 调整。重点是把训练用途的扩展 UA 单独声明不要写成User-agent: * Disallow: /否则可能影响搜索收录User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: GPTBot Disallow: / User-agent: Bytespider Disallow: / User-agent: * Allow: /Cloudflare 设置开启后已承诺遵守的搜索引擎会按规则区分搜索收录和 AI 训练。但 robots.txt 不是防火墙对恶意爬虫和伪装 UA 仍要配合 WAF。4.2 WAF/防火墙表达式示例先验证再拦截在 Cloudflare WAF 中可以先用日志模式观察再切到拦截。示例表达式把疑似训练爬虫与已验证 bot 分开(http.user_agent contains GPTBot or http.user_agent contains CCBot or http.user_agent contains Bytespider or http.user_agent contains Applebot-Extended or http.user_agent contains Google-Extended) and not cf.client.bot这个表达式只是起点不同套餐字段可用性不同。更稳的做法是对未验证 UA 做 Managed Challenge对已验证搜索引擎放行对高频异常 IP 做速率限制。不要把cf.client.bot简单等同于“所有好爬虫”也不要因为一个 UA 字符串就永久封段。4.3 网关侧 Key 限流把 Token 消耗关进笼子自有业务脚本是 Token 消耗大头。Nginx 可按脱敏 Key 前缀限流map $http_authorization $taotoken_key_prefix { default ; ~*^Bearer\s(.{8}) $1; } limit_req_zone $taotoken_key_prefix zonetaotoken_key:10m rate30r/m; server { location /v1/ { limit_req zonetaotoken_key burst10 nodelay; proxy_pass https://taotoken.net/api/; proxy_set_header Authorization $http_authorization; } }上面的配置用于说明思路按 Key 前缀做限流维度而不是按 IP 一刀切。正式环境要把proxy_pass、超时、重试、日志脱敏与 TaoToken 文档对齐。另一个动作是在 TaoToken 控制台 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_contentkey_limit_console 给每个 Key 设置可识别名称和用量观察把无主 Key 轮换掉。若你需要新建或重建 Key直接走控制台不要复用旧脚本里的硬编码。4.4 一次带 Key 的回归请求记录规则改完后必须做一次回归。用curl带 Key 请求 TaoToken Base URL确认请求成功并在网关日志里能看到 UA、路径、脱敏 Key 前缀。下面以 OpenAI 兼容路径举例模型名换成你控制台可见的curl -sS https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer YOUR_API_KEY \ -H Content-Type: application/json \ -d { model: 你的模型名, messages: [ {role: user, content: ping for audit} ], max_tokens: 16 }如果你使用 Anthropic 兼容路径则按 Claude Code 的方式走curl -sS https://taotoken.net/api/v1/messages \ -H x-api-key: YOUR_API_KEY \ -H anthropic-version: 2023-06-01 \ -H content-type: application/json \ -d { model: 你的模型名, max_tokens: 16, messages: [ {role: user, content: ping for audit} ] }回归记录建议包含时间、来源 IP、UA、请求路径、Key 前缀、状态码、响应耗时、是否命中限流。然后在网关日志中 grep 这个前缀和时间窗口grep YOUR_API_KEY_PREFIX /var/log/nginx/access.log \ | grep v1/messages\|v1/chat/completions\|v1/responses \ | tail -20如果日志里没有出现说明请求没走你的网关或者日志格式没有记录 Header如果出现但 Key 前缀为空说明脱敏字段没生效。回归通过后再把 WAF 规则从观察切到拦截并保留一周观察窗口。5. 把审计结论落到 TaoToken 接入模型对话、Coding Plan、创建 Key、Claude Code 文档排查到最后你会发现“Cloudflare 开了 Disallow AI Training谁还在用 TaoToken Key 消耗 Token”不是一个单点问题而是两条链路的交接网页抓取链路由 Cloudflare/robots.txt 管理模型调用链路由 TaoToken Key、Base URL、客户端配置和网关限流管理。前者避免内容被训练用途爬虫带走后者避免内部工具和脚本在不知情的情况下继续扣 Token。建议按下面顺序收口先在模型对话页验证模型可用性https://taotoken.net/models/detail/chat?utm_sourcetaotoken_aicg_blog_endutm_contentcf_audit_chat如果团队要长期用于编码工具查看 Coding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcf_audit_plan为 Claude Code、Codex、CC Switch 分别创建独立 Keyhttps://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentcf_audit_keysClaude Code 的完整接入步骤参考文档https://taotoken.net/doc/ClaudeCodeAnthropic?utm_sourcetaotoken_aicg_blog_endutm_contentcf_audit_claude_code最后再提醒三个容易踩的点。第一Cloudflare 的新设置不会替你回收 TaoToken KeyKey 治理必须在控制台和网关做。第二不要把ANTHROPIC_*配到 CodexCodex 用config.toml和独立环境变量。第三日志里只保留脱敏 Key 前缀完整 Key 一旦进入日志系统就应该视为泄露并轮换。把 UA、路径、Key 前缀三路对照做成例行巡检你就能清楚回答搜索收录爬虫在正常收录AI 训练爬虫被规则约束自有业务脚本按 Key 限额消耗。