昨晚十一点半,我看到 Anthropic 发布新旗舰 Claude Fable 5.1 的公告:智能指数 66 分直接登顶,自家八项基准测试全榜第一。公告里还强调,新旗舰比上一代便宜 25%,智能体类任务最多能省 45%。性能白嫖一档,这种好事谁忍得住?我顺手就把手头一个长文档 Agent 的主力模型切了过去。
跑完一轮真实任务,打开用量明细,人有点傻:同样的活,花的钱比 Fable 5 还多了两成。
不是公告骗人,是"降价"这两个字的算法变了。
一、标价没动,动的是缓存价
先看数字。Fable 5.1 的输入输出标价和上一代完全一样:10 美元 / 50 美元每百万 Token。所谓便宜 25%,几乎全来自一个不起眼的条目——缓存读取价格从每百万 1 美元砍到 0.25 美元,降幅 75%。
这等于把话挑明了:厂商的降价,押注在你的缓存命中率上。系统提示词、工具定义、反复引用的长文档,能被缓存住的部分越多,你越便宜;每次都现算现卖,那 25% 跟你没关系。
但更值得琢磨的是另一个数。Artificial Analysis 的实测结论是,Fable 5.1 的单任务实际成本反而比 Fable 5 高约 20%,根源在于新模型"更能想",平均每个任务多烧了 1.7 倍的输出 Token——而输出价格是输入的 5 倍,输出一膨胀,缓存省下的钱全被吃回去了。
能力强了,话也多了,账单随之起舞。官方口径的"省 25%"和实测的"贵 20%"其实并不矛盾:同样的用量结构,它确实更便宜;只是真实任务下,模型把用量结构悄悄改了。
二、全行业都在把降价做成"精细活"
把视角拉远,这一轮降价潮的画风已经变了。央视财经援引咨询机构"企业DNA"的报告说,美国前沿模型的降价速度快得不寻常——半年多前还在搞高端溢价,如今更像是普通大宗商品的基建竞赛。
各家出的牌也各不相同。OpenAI 一边把某款模型的输出价下调 20% 以上、压到 20 美元,一边让旗舰 GPT-5.6 Sol 守着 8/30 美元的高位不动;Google 的 Gemini 3.8 Flash 在 9 月 2 日以 0.75/3.75 美元的低价档上线,延续上个月 Gemini 3.7 Flash 把 Flash 系列定价砍半的打法,还明说 2027 年 1 月 1 日起价格翻倍——把"便宜"做成了限时预期管理;Anthropic 自己 8 月还取消了原定的涨价计划。国产这边同样没闲着,Kimi K3 带着 2.8T 参数、3/15 美元的定价登场,智能指数已经摸到 60 分这条前沿线,GLM-5.3-Flash 的首发半价则要撑到 9 月 9 日。
发现没有?没有一家还在做统一定价这种粗活。峰谷价、缓存价、首发价、档位价,模型厂商开始像电网一样精算你的用量结构。单价这张表越来越没参考价值——同一个任务,缓存命不命中、跑在哪个时段、开哪个推理档位,成本能差出好几倍。Anthropic 内部工程师分享过一个例子:低推理档位的 Fable 5.1,性能约等于 Fable 5 高配,成本却只要三分之一。
三、省钱的新功课:把每次调用的"结构"看清楚
对开发者来说,这意味着成本管理从"选哪个模型"变成了"怎么调这个模型":缓存命中率能不能做上去,输出放大能不能按住,简单任务是不是该开低档位、复杂任务才舍得用旗舰。这些变量肉眼看不见,账单上也不会写。
我的做法是接一个能摊开明细的聚合层。我现在用EasyAPI这类的网关,后台能看到每次调用的模型、缓存命中情况和实际扣费,模型切换、调度、降级都统一在一层处理。换上去之后我做的第一件事,是拉一张按"模型 × 缓存命中 × 时段"分组的成本表——哪些钱花得值、哪些在重复烧,一目了然。这种能力自己搭不现实,但只盯官方标价更不现实。

模型厂商把降价做成了精细活,开发者想接住这份"便宜",也只能做精细活。标价时代的省钱逻辑是货比三家;结构时代的省钱逻辑,是看清每一次调用的真实结构——我身边不少人把 EasyAPI 这类网关当账单仪表盘用,盯的就是这个。价格战还会继续,但先把结构看清的人,才接得住下一轮降价。

376

被折叠的 条评论
为什么被折叠?



