模型不是变便宜了,是算力被榨得更干净了——聊聊 token 价格战背后那本算力账

发布时间:2026/10/4 8:39:12
模型不是变便宜了,是算力被榨得更干净了——聊聊 token 价格战背后那本算力账 上个月我把几家主流模型 API 的账单拉出来对比发现一件挺有意思的事——半年前同样的 token 量现在花的钱不到一半有一家甚至降到了原来的三分之一。我第一反应是白菜价时代来了但仔细一想不对GPU 的成本这两年没怎么降那钱省在哪了总不能是厂商在赔本赚吆喝吧。我翻了一圈厂商发布的技术说明才慢慢回过味来token 便宜了不是模型本身变便宜了是同一块 GPU 上能塞进去、能跑完的请求变多了单位成本被硬生生摊薄了。说白了是算力被榨得更干净了。先说一个最核心的东西叫动态批处理Dynamic Batching。以前推理一个请求就是一张卡一个请求干等GPU 闲着大半天都在等数据传输。现在厂商会把同时涌进来的几十个请求打包成一批一起喂给 GPU矩阵运算Matrix Multiplication就是模型最耗算力的那步乘法瞬间被填满卡的利用率从百分之三四十一路爬到百分之七八十。利用率翻一倍分摊到每个 token 上的成本就腰斩一次。这玩意儿听着像技术优化其实本质是商业逻辑——卡的每一秒都在烧钱能多装一个请求就多赚一份钱。我一开始以为动态批处理是天上掉下来的后来才发现它的难点不在把请求堆一起而在怎么让长短不一的请求不互相拖累。有人排进来是个超长的问题有人只是回一句你好硬塞一批慢的拖住快的整个批次的延迟就崩了。厂商后来搞出个精细调度把长度相近的请求分到同一批再配合显存里的预分配把不同长度的位置提前留好才把这个事真正做顺。我记得有篇技术博客提过光是这一步峰值吞吐就能差出好几倍这也是为什么同是 7B 的模型有的厂子敢卖你几块钱每百万 token有的只能压着成本线走。哦这里插句闲话。我朋友看完这些技术文档后一脸严肃地问我说是不是搞个批处理就能躺着省钱他也想给自己的小服务加上。我赶紧泼冷水——批处理在别人那是降本神器在你自己那台只接几个客户的小服务上纯属给自己添堵batch 一开单个请求还得等同伴凑齐延迟反而上去了。优化这玩意儿永远是场景决定对错不是技术越先进越好。再一个就是 KV 缓存复用KV Cache Reuse。模型每次回答问题都要把前面读过的内容先记下来才能接着写这份记忆存在哪、存不存得下直接决定一次推理花多少钱。聪明的厂商发现很多请求的开头是一模一样的——比如系统提示词、产品说明、一段公共上下文。他们就把这段重复的开头算一次、缓存起来后面的请求直接复用不用重算。你自己想一个客服机器人的每个问题都带着同一份公司介绍这块缓存一命中前几百个 token 的成本基本等于零。这招我之前写过一篇专门聊缓存降本的文章但今天想强调的是它和批处理是一套组合拳——批处理管宽度把请求塞满缓存管深度把重复的开头省掉两个一叠成本曲线才真正被压平。还有投机解码Speculative Decoding这个更有意思。它让一个又快又小的小模型先猜答案大模型只负责点头确认猜对了就大步往前跳一次生成好几个 token速度上来之后卡被占用的总时长变短了单位成本自然也跟着下来。听起来像个取巧的把戏但它在很多场景里真的能把吞吐拉上去一大截。不过它也有个前提——小模型得猜得够准猜错率一高等于多跑一遍白忙活。聊到这你可能会想那是不是价格会一路跌下去我觉得短期会长期未必。token 价格战的本质是厂商在拿同一块卡榨得更狠换市场份额这个红利吃到一定程度就见底了。等利用率高到接近天花板、缓存命中率也到顶了再往下压价就只能靠真金白银的硬件更新——比如更好的芯片、更大的显存、更快的互联。到那个阶段价格战的节奏会慢下来拼的就不是谁会省钱了而是谁的钱花在刀刃上。这对我们做工程的人意味着什么挺实际的。你现在选模型 API如果还盯着每百万 token 单价那一个数字比很容易被表面的低价带跑。同一个厂商动态批处理优化得好、缓存命中率高它给你报的价格就能低得很自信但你要真拿一个全是长尾、随机性极强的请求场景去跑那个低价未必算得过来。所以我现在的习惯是拿自己真实的流量脚本去压一遍算每千次请求的实际成本而不是看官网那张漂亮的价格表。那个数字才是厂商那本算力账在你身上的真实投影。说到这我突然想起个画面——我小时候在批发市场看人卖水果同样是草莓有人筐大摆得满看着便宜有人筐小但颗颗挑过也不贵。后来我才明白便宜从来不是数字小是你买到手的那部分值不值这个价。算力这东西也是一样最终账得算在你自己身上。那我想留个问题给你你现在用的模型 API是照着官网价格表选的还是拿真实流量算过一笔账价格战打到今天你有没有被哪个每百万 token 只要几块钱的广告语忽悠过评论区聊聊我也挺好奇大家的真实账单长啥样。