DeepSeek把Pro请求路由到Flash还按Flash计费,这步棋比降价更狠

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

凌晨时候,盯着监控面板发呆——DeepSeek的API账单又创新高。不是因为单价涨了,而是Agent一晚上跑了12万次调用,每次都带着8000 Token的上下文。琢磨着要不要换个便宜点的模型,但V4 Pro的推理质量刚调到满意,换就白折腾了。

今天打开DeepSeek开放平台,你可能会愣一下:V4.1 Flash要来了,而且V4 Pro的请求会被自动路由到V4.1 Flash,按Flash的价格计费。翻译一下就是——你没改一行代码,账单直接缩水,模型还变强了。

先说降价:缓存命中砍掉60%

9月10日12:00起,DeepSeek Flash系列执行新定价。空闲时段,输入缓存命中从0.05元降到0.02元/百万Token,降幅60%;缓存未命中从1.5元降到1元,降33%;输出从4.5元降到4元。高峰时段价格是空闲的2倍,但对比旧价同样在降——缓存命中从0.1元砍到0.04元。

为什么说缓存命中这一档最重要?因为做Agent的开发者都知道,大头花在哪。系统提示词是固定的,RAG召回的文档块是稳定的,这些前缀每次请求都在重复发送。缓存命中意味着这部分几乎不算钱。0.02元/百万Token,算下来一万次请求的缓存前缀成本不到一块钱。对比GPT-6 Astra的10美元/百万Token输入价,差了两个数量级。

CSDN上有人做了实测对比:DeepSeek V3搭配高缓存,单次请求成本0.00049美元,月账单(每天10万次调用)147美元。同场景下GPT-4o是3900美元。这次Flash再降一轮,差距只会更大。

再说路由:把Pro流量导给Flash,按Flash收钱

这一步比降价有意思多了。DeepSeek官方说:V4.1 Flash正式上线之后、V4.1 Pro上线之前,所有发往V4 Pro的请求会自动路由到V4.1 Flash,计费按Flash单价走。

你没看错——用户调的是Pro,跑的是Flash,付的是Flash的钱。这不是临时过渡,这是一种产品策略。V4.1 Flash经过多方测试,性能、速度、成本、总用时全面超越V4 Pro。换句话说,新版Flash在能力上已经吃掉了上一代Pro的位置,DeepSeek干脆把价格也一起拉下来。

对开发者的影响很直接:你之前用V4 Pro搭的Agent、写的Prompt、调的参数,全都不用动。请求照发,后端自动切换,你甚至感知不到。但月底看账单,同样的调用量,费用降了。这比让你手动切换模型友好太多——有多少人改一次模型版本就要跑三天回归测试?

最后说格局:降价是表,IPO是里

同一天爆出来的消息:DeepSeek已委托中信证券筹备科创板IPO,目前已进入尽调阶段,计划年内启动上市流程。今年6月刚完成超500亿元外部融资,腾讯、宁德时代、京东、网易、IDG都在股东名册里。

把这两件事放一起看就清楚了。降价换的是调用量和开发者心智,IPO要的是市场规模和增长曲线。高盛预测中国AI模型的API及订阅收入会从2026年的350亿元涨到2030年的8790亿元,每日Token消耗量增幅约25倍。DeepSeek现在做的,就是把单价压到地板,把调用量撑到天花板,让“Token量”这个指标足够好看。

这个窗口期很难得

对独立开发者和小团队来说,大模型厂商在IPO前抢份额,价格战不会停,缓存策略会越来越激进,模型路由会越来越智能。与其在多家厂商之间反复比价、手动切key,不如找一个能把多家模型统一管理、自动路由的入口。

降价会持续,但不会永远这么猛。趁现在。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值