8月27日,阿里云宣布下调Qwen3.8-Flash模型计费单价,输入从1元降至0.8元/百万tokens,输出从3元降至2.7元/百万tokens。
仅仅四天之后,8月31日,阿里云再次出手——对北京地域Qwen3-VL-Rerank模型进行更大幅度的调价:文本输入从0.7元降至0.5元/百万tokens,多模态输入从1.8元直降到0.5元/百万tokens,降幅高达72%。
一周之内两次降价。这不是阿里云心血来潮,是国内Flash模型价格战已经打到了白热化的信号。
多模态重排序,一个容易被忽略的刚需场景
Qwen3-VL-Rerank不是聊天模型,它做的是另一件事——重排序(Rerank)。
简单说,当你在一个知识库里搜东西,系统会先捞出几百个可能相关的结果,但排序往往不准。Qwen3-VL-Rerank做的就是对这些候选结果进行二次排序,把真正相关的那几条顶到最前面。
它支持文本、图像、视频三种输入,通过单塔交叉注意力理解跨模态语义。典型场景包括:图片问答类知识库的检索优化、图搜和视频检索的精准度提升、复杂多模态信息的高效检索。
换句话说,如果你在做RAG应用、多模态搜索、或者任何需要“先捞一批再精排”的系统,这个模型是绕不开的基础组件。
为什么是“重排序”先降?
注意一个细节:这次降价只降输入,输出不计费。
这意味着降价的影响直接体现在每一次检索调用上。对于高频调用Rerank的RAG应用来说,成本下降是立竿见影的。
结合8月27日Qwen3.8-Flash的降价,阿里云在文本生成和多模态检索两个方向同时压价。这不是随机调价,是在为AI应用的“检索-生成”全链路铺低成本底座。
对开发者意味着什么?
国内Flash模型的价格战已经从“标价”打到了“多模态输入”。
GLM-5.3-Flash和Qwen3.8-Flash的标价已经压到几乎分毫不差,现在阿里云在Rerank这个细分场景上又砍了一刀。多模态输入从1.8元降到0.5元,意味着原本觉得“多模态检索太贵”的应用场景,现在可以重新算账了。
当模型越来越多、价格越来越碎、场景越来越细分,你怎么在多个模型之间统一管理调用、对比成本、切换流量?
这就是EasyAPI这类聚合层做的事情——一个Key接入所有主流模型,统一记录调用延迟和成本,切换只改配置不碰业务代码。阿里云降价了,你改个配置就能把流量切过去;下周另一家降价了,你再切回来。不用跟着每一轮调价改代码。
还有其他的很多主流大模型可选
阿里云一周内两次调价,说明一件事:价格战不会停,只会越来越细。下次看到“某模型降价”的新闻,不用急着改代码,先看看你的调用层有没有把这个降价红利接住的能力。

175

被折叠的 条评论
为什么被折叠?



