阿里云百炼一周内两次降价,国内Flash价格战进入白热化

8月27日,阿里云宣布下调Qwen3.8-Flash模型计费单价,输入从1元降至0.8元/百万tokens,输出从3元降至2.7元/百万tokens。

仅仅四天之后,8月31日,阿里云再次出手——对北京地域Qwen3-VL-Rerank模型进行更大幅度的调价:文本输入从0.7元降至0.5元/百万tokens,多模态输入从1.8元直降到0.5元/百万tokens,降幅高达72%

一周之内两次降价。这不是阿里云心血来潮,是国内Flash模型价格战已经打到了白热化的信号。

多模态重排序,一个容易被忽略的刚需场景

Qwen3-VL-Rerank不是聊天模型,它做的是另一件事——重排序(Rerank)

简单说,当你在一个知识库里搜东西,系统会先捞出几百个可能相关的结果,但排序往往不准。Qwen3-VL-Rerank做的就是对这些候选结果进行二次排序,把真正相关的那几条顶到最前面。

它支持文本、图像、视频三种输入,通过单塔交叉注意力理解跨模态语义。典型场景包括:图片问答类知识库的检索优化、图搜和视频检索的精准度提升、复杂多模态信息的高效检索。

换句话说,如果你在做RAG应用、多模态搜索、或者任何需要“先捞一批再精排”的系统,这个模型是绕不开的基础组件。

为什么是“重排序”先降?

注意一个细节:这次降价只降输入,输出不计费。

这意味着降价的影响直接体现在每一次检索调用上。对于高频调用Rerank的RAG应用来说,成本下降是立竿见影的。

结合8月27日Qwen3.8-Flash的降价,阿里云在文本生成多模态检索两个方向同时压价。这不是随机调价,是在为AI应用的“检索-生成”全链路铺低成本底座。

对开发者意味着什么?

国内Flash模型的价格战已经从“标价”打到了“多模态输入”。

GLM-5.3-Flash和Qwen3.8-Flash的标价已经压到几乎分毫不差,现在阿里云在Rerank这个细分场景上又砍了一刀。多模态输入从1.8元降到0.5元,意味着原本觉得“多模态检索太贵”的应用场景,现在可以重新算账了。

当模型越来越多、价格越来越碎、场景越来越细分,你怎么在多个模型之间统一管理调用、对比成本、切换流量?

这就是EasyAPI这类聚合层做的事情——一个Key接入所有主流模型,统一记录调用延迟和成本,切换只改配置不碰业务代码。阿里云降价了,你改个配置就能把流量切过去;下周另一家降价了,你再切回来。不用跟着每一轮调价改代码。

还有其他的很多主流大模型可选

阿里云一周内两次调价,说明一件事:价格战不会停,只会越来越细。下次看到“某模型降价”的新闻,不用急着改代码,先看看你的调用层有没有把这个降价红利接住的能力。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值