模型价格开始有“保质期”了

上周刚根据一份价格表把下季度的成本预算算好,这周一打开公告,价格表作废了。

9月9日,DeepSeek开放平台发布公告:9月10日12:00起,flash系列降价——空闲时段缓存命中输入从每百万Token 0.05元降到0.02元,砍掉六成;缓存未命中从1.5元降到1元;输出从4.5元降到4元。[1]

有印象的朋友应该记得,8月13日DeepSeek V4 Pro正式版上线时,API刚涨过一轮——最高涨幅达11倍。当时不少开发者直言“高峰时段没有性价比了”。涨了不到一个月,又部分调了回来。[2]

这不是简单的回调,而是一个信号:模型价格正在从“年度策略”变成“随版本快闪的变量”。

价格跟着版本节奏走,不再按年规划

把这次降价拆开看,逻辑其实很清楚。9月8日DeepSeek刚在官方群开启V4.1 Flash的内测,官方口径是“能力更强、速度更快、成本更低”。一天后,老flash系列降价落地。[3]

更微妙的是回调的幅度:缓存命中和未命中的输入价回到了8月涨价前的水平(0.02元和1元),但输出价还是4元,是涨价前2元的两倍。也就是说,这不是“恢复原价”,而是重新配比:鼓励你多用缓存、多在闲时跑,输出该贵还是贵。

对开发者来说,这意味着“根据一份静态价格表做年度成本规划”这件事,正在失去意义。价格表的半衰期,现在大概是以周为单位。

“限时优惠”成了行业标配

看看这个月其他家的动作,你会发现DeepSeek不是特例。

智谱GLM-5.3-Flash的首发半价,9月9日24:00到期——如果你一直在按促销价跑它,今天得去看看续期价格了。[4]

Google的Gemini 3.8 Flash更直接:首发价输入0.75美元、输出3.75美元/百万token,公告里写明优惠持续至2026年底,之后回到1.5美元与7.5美元。[5]

再往大了看,2024年5月,通义千问Qwen-Long API输入价格从0.02元/千tokens直降97%,低至0.0005元/千tokens;同期腾讯混元-lite直接调整为免费——低价是获客手段,而手段是有期限的。[6][7]

调价频率已经高到按周计算。当调价频率高到这个程度,“当前价格”更像是电商页面上的限时促销价,而不是一份契约。

把价格当变量,把架构做钝感

既然价格会动,能做的是让系统对价格波动不那么敏感。几个实际的做法:

一是盯住“结构性便宜”而不是“标价便宜”。这次DeepSeek降价后,缓存命中价格是缓存未命中的五十分之一,高峰时段价格是闲时的两倍。提示词固定、系统指令复用这类缓存命中率高的场景,闲时跑批处理任务,降幅比标价上那11%实在得多。

二是把模型调用这层做薄。价格一变,最麻烦的不是账单,而是代码里写死的调用逻辑。我现在的做法是把路由配置和业务代码分开,接在EasyAPI这类聚合网关后面——一个Key调300+模型,兼容OpenAI格式。厂商调价或者要换渠道时,改一行配置就行,业务代码一行不动。这半个月DeepSeek先涨后降、GLM促销到期,我基本没为价格改过代码。

三是给成本测算留个“重算按钮”。预算表别做成Excel死值,做成脚本,价格表更新时重跑一遍。算准今天的成本意义不大,能在一小时内重算明天的成本才有用。

模型的价格战打到今天,比拼的已经不只是谁便宜,而是谁的价格变得更快——变得快,说明厂商在用价格实时调节供需。对开发者来说,唯一确定的是:你今天看到的价格,是有保质期的。


数据来源:

[1] DeepSeek官方公告(2026.9.9)

[2] DeepSeek V4 Pro调价通知(2026.8.13),最高涨幅11倍

[3] DeepSeek官方交流群内测公告(2026.9.8)

[4] 智谱AI GLM-5.3-Flash官方定价页,限时半价至2026.9.9

[5] Google Gemini 3.8 Flash发布公告(2026.9.2),优惠价至2026年底

[6] 阿里云通义千问Qwen-Long调价公告(2024.5),输入价直降97%

[7] 腾讯混元-lite免费公告(2024.5)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值