9月9日,DeepSeek开放平台发布公告,宣布将于北京时间2026年9月10日12:00起,调整Flash系列模型的API调用定价。这是继8月17日峰谷计费涨价之后,DeepSeek在不到一个月内再次调整价格体系——这一次,方向是降价。
降价细节:缓存命中从0.05元降至0.02元
调整后的价格结构如下:
| 计费项 | 调整前(空闲时段) | 调整后(空闲时段) | 降幅 |
|---|---|---|---|
| 输入(缓存命中) | 0.05元/百万Token | 0.02元/百万Token | 60% |
| 输入(缓存未命中) | 1.5元/百万Token | 1元/百万Token | 33% |
| 输出 | 4.5元/百万Token | 4元/百万Token | 11% |
高峰时段(周一至周五9:00-12:00、14:00-18:00)价格为空闲时段价格的2倍。具体来看,高峰时段缓存命中输入从0.10元降至0.04元,同样降幅60%。
缓存命中输入价格的60%降幅,是这次调整中幅度最大的一项。 而缓存命中,恰恰是Agent工作负载中最关键的变量。
为什么缓存命中价格如此重要?
在Agent场景中,输入Token通常远多于输出Token。一个典型的Agent任务——比如代码分析、长文档处理、多轮工具调用——需要反复读取相同的上下文:系统提示、工具定义、历史对话、代码库片段。这些重复读取的Token,如果命中缓存,只需支付缓存命中价格;如果未命中,则按缓存未命中价格计费。
两者价差有多大?调整后,空闲时段缓存命中输入仅0.02元/百万Token,而缓存未命中输入为1元/百万Token——相差50倍。也就是说,同样一段上下文,命中和未命中的成本差了两个数量级。
DeepSeek的一大卖点就是极高的缓存命中率。以DeepSeek-Native的Reasonix工具为例,通过前缀缓存优化,长会话的缓存命中率可以保持在90%以上,甚至有实测案例达到99.82%。在这种命中率下,缓存命中价格的变动会直接放大到整个账单上。
缓存命中价格降60%,对高命中率的Agent工作流来说,综合成本下降可能远不止60%。 有开发者估算,典型Agent工作流的综合成本可下降约40%。这是因为在Agent场景中,输入Token占总Token消耗的大头,而缓存命中又占了输入Token的大头——一个60%的折扣,乘以一个90%的命中率,再乘以一个70%的输入占比,最终体现在总账单上就是接近腰斩。
从涨价到降价:不到一个月的价格波动
这次降价距离上一轮涨价只有三周多。
8月17日,DeepSeek峰谷计费生效时,Flash系列的价格曾大幅上调:缓存命中输入从0.02元涨到0.05元(涨幅150%),缓存未命中输入从1元涨到1.5元(涨幅50%),输出从2元涨到4.5元(涨幅125%)。
不到一个月,DeepSeek又把缓存命中价格降回了接近涨价前的水平(0.02元),同时维持了缓存未命中(1元)和输出(4元)的较高价位。这种“涨输出、降缓存”的结构性调整,传递了一个明确的信号:
DeepSeek在鼓励开发者优化调用方式——多用缓存、少做无用计算。 用缓存命中的低价换取更高的缓存命中率,从而降低整体成本;同时通过输出价的适度上调,引导开发者减少不必要的冗余输出。
对开发者来说,这意味着“怎么调”比“调谁”更关键。同一个模型,用对方式调用和随意调用,成本可能差出好几倍。
对开发者的意义
这次降价最直接的受益者是Agent开发者。长会话、多轮工具调用、代码分析、文档处理——这些场景的输入Token占比高、缓存命中率潜力大,降价后成本优势会更明显。
有开发者算过一笔账:以高峰时段为例,缓存命中价格从0.10元降至0.04元。对于一个每天处理大量长上下文请求的Agent系统,仅这一项每月就能省下可观的开支。如果配合前缀缓存优化工具(如Reasonix)将命中率提升到90%以上,实际成本下降幅度会更加显著。
模型越来越多,你需要统一的管理层
DeepSeek的这次降价,放在更大的行业背景里看,是价格战从“标价”转向“结构优化”的一个信号。从8月的峰谷涨价到9月的缓存降价,DeepSeek在不到一个月内完成了两次价格调整,方向相反、逻辑一致——用价格引导开发者优化调用方式。
但这也意味着,价格会继续波动。今天缓存降价,明天输出可能涨价;这个月DeepSeek便宜,下个月可能Qwen更有优势。如果你在每个模型的控制台里分别翻账单、分别适配接口,每一轮价格调整都会变成一次改代码的体力活。
价格战还会继续,但你可以不用每次都跟着折腾。
数据来源:
根据DeepSeek开放平台2026年9月9日发布的公告,Flash系列API价格于9月10日12:00起调整,缓存命中输入从0.05元降至0.02元,降幅60%(综合IT之家、腾讯新闻、凤凰网科技等多家媒体报道)。

502

被折叠的 条评论
为什么被折叠?



