9月9日,DeepSeek开放平台发布了一则通知:V4.1 Flash正式上线后、V4.1 Pro上线之前,所有指向V4 Pro的API请求将被系统路由到V4.1 Flash处理,并按Flash的更低单价计费。用户零改造,性能变强,账单变便宜。
这在大模型行业里相当罕见——通常降价是降价,换代是换代,DeepSeek把两件事一次做完了。
性能与价格同步调整
先看硬指标。V4.1 Flash采用新的模型结构,原生支持多模态,社区内测生成速度约284 tokens/秒,部分场景跑到350-400 tokens/秒,相较现役V4的约97 tokens/秒提速近2倍,对需要反复迭代的编程场景尤其明显。
价格方面,自9月10日12:00起执行新定价(每百万Token):
| 时段 | 缓存命中输入 | 未命中输入 | 输出 |
|---|---|---|---|
| 闲时 | 0.02元 | 1元 | 4元 |
| 高峰 | 0.04元 | 2元 | 8元 |
缓存命中输入价格降幅60%,未命中输入降约33%,输出降约11%。工作日9:00-12:00、14:00-18:00为高峰时段,价格为闲时2倍。
行业背景:海外降价与国产分层的双重变奏
把这周的关键数据摆在一起看,行业路径的分化很明显。
海外方面,降价是为IPO蓄势。Anthropic估值目标2万亿美元,OpenAI估值万亿级美元,摩根士丹利牵头的150亿美元循环信贷接近获批。OpenAI把GPT-5.6 Sol砍到$4/$20并锁定至11月21日,Anthropic让Sonnet 5的$2/$10入门价永久化。当用户已形成“全行业1美元以下”的预期,IPO后想涨价就难了。
国产方面则是分层定价。DeepSeek走的是“闲时降到接近边际成本+高峰维持合理利润”的峰谷组合拳;智谱则反方向,2026上半年API平均售价较年初提升101%,毛利率从-0.4%升至24.6%,单位Token推理成本下降80%。流量大不等于便宜,国产模型的分层远比想象中复杂。
对开发者的三层影响
Silicon Data的LLM Token支出指数9月3日首次跌破0.97美元/百万,较夏季高点腰斩50%以上。但这不是“全行业在降价”,而是“需求正在向低价模型迁移”。
第一层,缓存设计。 DeepSeek缓存命中输入0.02元/百万、Anthropic Fable 5.1缓存读0.25美元/百万(降75%),只要场景里有30%以上重复Prompt,缓存命中率优化就能砍掉一半账单。
第二层,任务分层。 80%简单任务走国产Flash,15%走中等模型,5%才上旗舰。同一笔预算,混合路由比全用旗舰省97%。
第三层,峰谷错峰。 DeepSeek高峰时段为空闲时段2倍,对延迟不敏感的后台批处理、文档摘要、数据打标,完全可以夜间批量调度,光这一项就能省50%。
需要留意的问题
需要指出的是,这次路由策略在开源社区引发了一些讨论。有开发者认为,model_id对开发者而言是一份稳定的隐性契约——提示词里的措辞、few-shot的格式、输出的行为,都是围绕某个具体模型调出来的。静默替换背后的模型,可能导致行为漂移,而用户直到出问题才知道。
也有开发者建议,平台可以发公告、给迁移期,让用户自己决定什么时候切换。这个问题值得关注——换代本身不是问题,静默发生才是。
当模型越来越多,你需要统一的管理层
V4.1 Flash确实更快更便宜。DeepSeek已经替用户做了迁移,你需要确认日志里看到的是V4.1 Flash,并重新评估内部计费模型。
如果你同时在用DeepSeek、GPT、Claude、Qwen等多个模型,切换和账单这种脏活可以交给EasyAPI:一个接口管理所有模型,自动按任务路由到最划算的模型,切换只改配置不碰业务代码。模型价格在变、路由策略在变,但调用层可以保持稳定。
数据来源:
-
DeepSeek开放平台公告,IT之家、36氪、CNMO科技等媒体报道
-
电子工程专辑、Jiemian.com价格调整报道
-
OpenAI GPT-5.6 Sol降价公告
-
Anthropic Sonnet 5定价公告
-
开源中国社区讨论

416

被折叠的 条评论
为什么被折叠?



