DeepSeek Flash API 再降价60%:V4.1内测同日开启意味着什么

发布时间:2026/9/10 13:27:31
DeepSeek Flash API 再降价60%:V4.1内测同日开启意味着什么 9 月 9 日DeepSeek 开放平台发公告自北京时间 9 月 10 日 12 时起下调 flash 系列模型调用价格。据观察者网报道输入缓存命中、输入缓存未命中、输出三档价格最高降幅分别为 60%、33.33% 和 11.11%。同一天V4.1 Flash 的中间版本还在内测。涨价不到一个月又降价这件事对写代码的人来说值得看清楚。先把降价本身说清楚这次调价只涉及 flash 系列两款模型deepseek-v4-flash和deepseek-v4-flash-vision-exp执行同一套标准。据公开公告具体数字是计价项每百万 tokens空闲时段调整前→调整后高峰时段调整前→调整后输入·缓存命中0.05 元 → 0.02 元0.10 元 → 0.04 元输入·缓存未命中1.5 元 → 1.0 元3.0 元 → 2.0 元输出4.5 元 → 4.0 元9.0 元 → 8.0 元几个细节别忽略峰谷分时机制没变。工作日 9:00–12:00、14:00–18:00 算高峰其余时间算闲时闲时价是高峰的一半。也就是说单价虽然在降但什么时候调用仍然是影响账单的大头。没有完全回到涨价前。8 月 13 日随 V4 Pro 正式版上线平台上调过一轮 API 价格据报道 V4 Pro 系列最高涨幅达 11 倍。本次调整后空闲时段的缓存命中、缓存未命中价格回到了之前的 0.02 元和 1 元但输出价 4 元仍高于涨价前的 2 元。真正便宜的是缓存命中。0.02 元/百万 tokens 这个量级意味着重复的上下文系统提示词、长文档、代码库走缓存后成本几乎可以忽略。这不是玄学是提示词缓存prompt caching在定价上的直接体现。V4.1 Flash 内测别把它当成已发布据多家媒体报道9 月 8 日 DeepSeek 在官方交流群开启了 V4.1 Flash 的中间版本内测。官方口径是新模型采用了新的模型结构原生支持多模态并在能力、速度、成本上进一步优化。调用方式上据群内通知base_url不用改把模型名改成deepseek-v4.1-flash-expires-on-0910即可每个账号最多 20 路并发计费与deepseek-v4-flash相同。名字里的expires-on-0910也说明这是个临时内测版本。这里必须提醒一句截至发稿DeepSeek 官网、API 官方文档和更新日志中都还没有 V4.1 Flash 的正式发布记录公开文档里列出的仍是 V4-Flash-0731、V4-Pro-0813 和此前的 V4-Flash-Vision-Exp。所以网传的V4.1 全面超越 V4 Pro要替代 Pro 版本之类的说法目前只能算内测用户的反馈和猜测不是官方结论。技术本质价格战的底气是推理成本真的降了很多人只盯着降了多少其实更该问的是它凭什么降大模型 API 的价格本质由推理侧的单位成本决定。据公开资料V4 系列在长上下文场景下的单 token 推理计算量、KV Cache 占用相比更早的版本有明显下降据报道100 万 token 场景下计算量压到 V3.2 的约 27%KV Cache 占用降到约 10%。同一批显卡能扛更多并发单位成本自然下行。这解释了为什么 DeepSeek 敢在涨价一个月后又降回来不是单纯让利而是效率上来了、产能释放了。价格可以回调但用户的迁移成本不会自动回调——涨价期间已经切到别家模型的项目未必会切回来。这也是所有做 API 生意的厂商绕不开的问题。对开发者意味着什么怎么用最省如果你在做后端或 AI 应用集成这几点是能直接落到代码里的。第一把批量任务挪到闲时。定时任务、离线生成、数据清洗这类不要求实时性的活儿从高峰时段挪到闲时直接省一半。用 cron 或任务队列控制调度即可。第二认真做提示词缓存。把稳定不变的部分系统提示、长文档、代码仓库上下文放在 prompt 前部复用率越高命中缓存的 token 越多。这是当前降价后最有性价比的一块。第三调用代码本身不用改。DeepSeek API 兼容 OpenAI 的 SDK已有的项目基本只需改base_url和modelfromopenaiimportOpenAI clientOpenAI(api_key你的 API Key,base_urlhttps://api.deepseek.com,)respclient.chat.completions.create(modeldeepseek-v4-flash,messages[{role:system,content:你是一个严谨的技术文档助手。},{role:user,content:用三句话解释 KV Cache 的作用。},],)print(resp.choices[0].message.content)**几个坑提前说**-**别把内测模型名写死在生产环境**。带 expires-on-0910 的模型会过期写死了线上就报错。--**输出没回到涨价前**。如果业务里输出 token 占比高实际账单未必比涨价前更便宜别只看新闻标题。--**速度快 ≠ 账单低**。据内测开发者反馈新模型出结果快了很多但交互轮次和生成量往往随之上升token 消耗也会涨。单价没变的情况下总账单可能不降。省钱的关键始终是少调用、高缓存不是跑得快。## 结尾价格是商业决策涨也好、降也好都不必过度解读。对开发者真正有价值的是搞清楚计费模型**缓存命中、峰谷时段、输入输出比例**这三件事比追每一个新版本号更影响你的成本。你现在的 AI 应用调用成本主要花在哪一块评论区聊聊。