上下文塞满后,AI 变傻又烧钱:5 个省 Token 的做法

发布时间:2026/9/24 16:00:01
上下文塞满后,AI 变傻又烧钱:5 个省 Token 的做法 先看一组实测数字。同一个查 100 轮资料的任务不做处理时上下文峰值冲到 33.5 万 Token把自动压缩的触发点设在 18 万之后峰值降到 16.9 万任务收尾时只剩 5829 个 Token活照样干完了。这组轨迹来自 Anthropic 公开的实验记录不是挑出来的漂亮值。换句话说你账单上的大头未必花在AI 想得更多而是花在AI 反复重读同一堆历史。这篇分三层先说清 AI 为什么越聊越傻再讲 2026 年已经成熟的省 Token 技术给出普通用户今天就能动手的 5 件事。先补一个常识Token 是 AI 记录内容和计费的单位一个汉字大约算一到两个 Token下面出现的数字都按这个口径理解。一、AI 不是撑满窗口才变傻很多人以为上下文窗口像水杯装满之前一切正常。实际情况更像一张办公桌桌面堆到三分之一你找一份合同就要翻半天。Chroma 关于上下文腐烂的研究发现性能退化会在超过约 3 万 Token 后开始加速哪怕窗口里还有大量空位。3 万 Token 是什么量级让 AI 读完 30 页文档再聊十来轮基本就到了。什么是上下文腐烂context rot它不是指模型读不懂长文而是信息变多之后模型抓重点的能力反而下降。Anthropic 在 2025 年 9 月发布的上下文工程指南里给了另一层解释工具输出的原始数据是上下文增长的主要来源。浏览器截图、命令日志、整份 JSON、整篇网页正文一进上下文就赖着不走每一步推理还要重新发一遍。这也是 Agent 和普通聊天机器人的根本差别。聊天是一次问答Agent 是几十轮的读文件、调工具、看结果、再决定累计输入的 Token 可以是普通问答的 10 到 100 倍。所以真正的信号不是窗口快满了而是质量开始下滑。实践中的压缩触发点通常设在有效窗口的 60% 到 75%换成 200K 窗口的模型大约是 14 万 Token 那一条线。很多人问AI 助手越聊越笨怎么办答案往往不在提示词写得漂不漂亮而在上下文有没有被主动收拾。等窗口占用到 95% 才动手模型其实已经在退化区里跑了很久。二、成熟做法收敛成一条流水线Agent 上下文压缩怎么做才有效2026 年的答案不是某个技巧而是一条按成本递增排列的流水线。学界把它抽象成四步选出要压的部分、执行压缩、存到窗口之外、需要时恢复。业界反复实践出来的一句话是保护开头、压缩中间、保留近几轮。做法干的事公开效果要不要懂技术清理旧工具结果把用过的工具输出从历史里删掉留个占位符100 轮搜索任务 Token 少 84%完成情况反而更好不用多数平台已内置滚动压缩把前面的对话摘要成一段用摘要重开窗口峰值从 33.5 万降到 16.9 万 Token不用改个开关增量合并摘要不重写整份摘要只把新挤出去的那段合并进去在 36000 条真实工程会话上准确性与连续性优于从头重写不用上下文折叠把子任务的中间步骤折叠掉只留结论活跃上下文能小 10 倍100 轮交互后只剩约 7000 Token暂时不用属前沿提示词压缩用小模型逐个 Token 判断哪段信息量低直接删能到 20 倍压缩准确率只掉 1.5 个百分点不用KV 缓存压缩在推理层压缩模型的显存缓存有的方案能把缓存压到 2 bit自建推理才用得上这张表里值得注意的是顺序从便宜、可逆的操作开始再到有损的摘要末了才是模型和推理层的改动。清理旧工具结果排在前头因为它不花额外的模型调用结果也确定需要时还能重新取回来。摘要压缩则要另外调一次模型保得住大意逐字细节会丢。把这条流水线记成一句话先做不要钱的再做要点钱的末了才动模型本身。顺序颠倒钱花了效果还差。三、大厂已经把它做成了服务端开关一个实际的变化是这些事现在不用你自己写代码。Anthropic 在 2025 年 9 月底随 Claude Sonnet 4.5 上线了上下文编辑Context Editing。它默认在输入到 10 万 Token 时启动从更早的工具调用开始清理保留近三组并留下占位符告诉模型这里原本有个结果。在 100 轮网页搜索的评测里它把 Token 消耗降了 84%单独使用带来 29% 的性能提升配合记忆工具能到 39%。2026 年初同一个思路升级成服务端的一级特性压缩接口compact_20260112。它按 Token 阈值自动触发触发点可以设到 5 万、默认 15 万还能传入自定义的摘要指令等于把摘要怎么写从默认设置变成一份可打磨的工程文档。OpenAI 在 Responses API 里提供了对应的 context_management 加 compact_threshold。另一个独立端点更省事直接返回压缩好的上下文窗口。Claude Code 则把整件事拆成一条按成本递增的流水线。先调低工具输出的截断预算再截短老的工具输出只留一行摘要接着做局部内联压缩然后对更久远的历史做细粒度折叠末了才用大模型生成结构化摘要。它有一处很讲究优先压缩靠后的内容保住缓存前缀因为缓存的 Token 价格通常只有标准输入的一成左右。这里有个容易被忽略的取舍。压缩在语义上是一次硬切换会让此前缓存好的提示前缀失效而缓存本身又便宜得多。有团队在真实的 AI 教学产品上做过对比给出一个反直觉结论在开了提示缓存的场景里把内容都留着有时比做摘要更便宜、更快、记得也更牢。他们的建议是压缩应当是针对某个明确约束的主动选择不该成为默认动作。仙踪问道在给用户做本地部署和配置调优时看到的是另一面多数人的问题不是没开压缩而是触发点定得不对太早太晚都费钱。所以这项技术真正的门槛不在算法而在几个参数的取舍上下一节我们讲怎么定。四、普通用户今天就能做的 5 件事普通用户怎么省 AI 的 Token 费用其实不需要读论文。下面 5 件事按先做哪个排前两件不花钱、不担风险可以先动手。一是在任务边界上手动压缩别等自动触发。做完一个完整的活报告写完、功能改完、调试收尾就主动压一次。等自动压缩等于等模型已经在退化区里干了一阵活而写摘要的模型这时输入也很臃肿摘要质量会打折。Anthropic 推荐的配套动作是把进度写进文件、用 git 提交当检查点压缩之后还能顺着记录把状态接回来。二是把长期规则写进文件而不是留在对话里。项目规范、写作要求、内部红线写进 AGENTS.md 或 CLAUDE.md 这类配置文件或者写进 AI 工具的记忆功能。压缩只动对话历史不动磁盘上的文件规则就能跟着会话活下来。反过来看你在聊天框里口头交代的约束压缩一次就可能消失。三是一个任务一个会话。很多人的账单是隔夜会话堆出来的昨天的活做完不关今天接着聊几十万 Token 的陈旧历史每一步都要重发一遍。切换任务时开个新会话是成本很低的省钱动作。四是关掉用不上的工具和技能。工具定义本身也占上下文而且每一轮都要发一次。自己盘一盘有多少工具你这半年一次都没调用过有多少技能装了却从来不用把工具定义改成按需加载公开的实测是能省下约 85% 的相关 Token。五是给压缩触发点钉一个固定的上限而不是只看百分比。假设窗口是 100 万 Token压缩比例按默认的一半算就得累积到 50 万才触发等于根本不触发缓存的 Token 反复重发账单一路走高。窗口越大越需要钉一个固定数把触发点定在 12 万到 20 万之间按任务难度取一个值。仙踪问道在 Hermes 管理页里把这做成了三档节约档位保守 200K、推荐 150K、激进 120K。按实测数据触发点从默认值钉到 150K 之后单周缓存读取量从 5.76 亿降到 3.99 亿省了约三成。把这 5 件事连起来逻辑其实很简单别让 AI 反反复复重读它已经读过的东西。省下来的不是一分两分钱而是整个任务的分母。顺着这个话题说一句如果你用的是 macOS、也不想自己翻配置文件可以看看仙踪问道·爱马仕助手。它把 Hermes Agent 的安装、国内网络加速、模型接入都做进了图形界面。上面提到的节约档位和用量看板也在同一个界面里打开就能看到近 7 天的 Token 用量、缓存读取和压缩次数。它也支持把模型跑在本地目前仅苹果芯片数据不出本机长期看也是压成本的一条路。五、三个容易踩的坑坑一是压得太狠。压缩的失败其实有三类压之前判断错把后面还要用的关键信息删了压的过程中受长度限制被截断把已经验证过的结论丢了压完之后虽说从外部记忆里把东西找回来了却没有正确用上。它们的共同点是省下来的 Token 很显眼丢掉的正确性不显眼。坑二是只盯每次请求花多少不看每个任务花多少。这两种口径给出的结论经常相反。有商业压缩服务公开过一组经验让 Agent 每个会话少消耗 3 到 4 倍的 Token压缩被触发的频率也跟着低 3 到 4 倍。换句话说减少压缩的需求往往比把压缩本身做得更漂亮更划算。坑三是以为压缩免费。摘要要另外调一次模型是实打实的支出。有的 Agent 内置了防抖动机制某次压缩只省下不到 10% 的 Token就记一次无效压缩避免每轮都空转烧钱。如果你的工具支持这个指标值得定期看一眼。三个坑归到一句话省钱的目标不是让上下文尽量短而是让每个任务的总花费尽量低。结尾省 Token 是习惯不是开关这两年的变化很有意思。早些时候上下文压缩被当成一个成本优化技巧可有可无到 2026 年它已经变成 Agent 架构里的一等公民。对普通用户来说这意味着门槛在下降你不必读论文只要把触发点、会话边界和长期规则这三件事调对。归根结底AI 的上下文不是垃圾桶是一张需要你主动收拾的办公桌。你替它收拾得越勤它把活干得越利索账单也越好看。关注这个账号后面我会继续把 AI 工具里那些说不清的钱到底怎么花掉的拆成能对照的表和清单。你平时用 AI 干哪种活比较费 Token评论区说说你的情况留言里出现比较多的场景下一篇就写它。