开源追上来了:本周AI选型的三条新常识

打开OpenRouter周榜,前10名里挂着5个中国名字——Hy4 preview、GLM 5.3 Flash、DeepSeek V4 Flash 0731、MiMo-V2.5、DeepSeek V4 Flash 0423,加起来吃掉了一半的token流量。中国模型在Top10中合计占比约71.6%。

这个数字背后,是9月第一周发生的三件事,把“国产模型能不能用”这个旧问题直接换成了“为什么还要用闭源”。

训练成本砍到了十分位

9月2日,阿里发Qwen3.8-Max-0902,2.4T参数MoE、1M上下文,在CodeArena WebDev跑出1691分——压过Claude Opus 5的1688分。同份发布里披露了一行数据:训练成本约是Qwen3.7-Plus的九分之一。

9月10日,DeepSeek上V4.1 Flash,把对HBM的需求降到上代的1/4,SSD降到1/8,KV缓存压缩至每token 890字节。同样的智能水平,对硬件的胃口小了一个数量级。定价直接落到0.02元/百万Token(缓存命中),输出4元。

训练成本降一个数量级,推理成本降一个数量级——这才是价格能持续走低的结构性原因。

协议从“非商用限制”切到了MIT

8月底,智谱把GLM-5.3-Flash(320B参数、原生多模态、综合智能指数57)以MIT协议开源。之前GLM系列多带限制性条款,MIT的意思是:你下载权重、商用、改写、不必公开衍生品。

它在Artificial Analysis综合智能指数中拿到57分,与Claude Opus 4.8最高档得分持平。配上OpenRouter渠道价,比DeepSeek V4 Flash 0731还便宜一半。

Hugging Face 2026年春季报告的数据更直观:中国自研开源模型全球下载占比41%,首次超过美国的36.5%。

闭源那边把价格战打到缓存层

Anthropic 9月1日把Claude Fable 5.1的缓存读取价从1.00美元砍到0.25美元/百万Token——降75%,输入输出仍维持10/50美元的高位。Anthropic测算典型场景有效成本下降25%、Agent工作负载下降45%。

同期Sonnet 5涨价被取消,2/10美元正式永久。海外厂商的策略很明确:让“未缓存输入”看起来贵,让“缓存读”便宜到开发者主动去设计缓存。

三条正反馈循环第一次跑通

三件事组合起来,解释了OpenRouter榜单的变化。中国厂商把训练成本压到原来的零头、定价就有了空间;MIT协议让下游愿意集成、调用量就上来了;流量越大、推理成本越低、再让利给开发者——这条正反馈循环第一次在中国模型上跑通。

对独立开发者来说,三件事要更新进选型清单

第一,“国产=跑分强但难落地”该丢掉了。 GLM-5.3-Flash综合智能指数57、超过Qwen3.7-Plus和Claude Opus 4.6;Qwen3.8-Max在WebDev榜单是真跑分。

第二,“开源=弱”也站不住了。 MIT协议+极低的OpenRouter渠道价+1M上下文,这套组合在大多数业务场景里已经够用。

第三,“闭源=稳”剩下的价值是SLA、合规、企业集成,不是基础智能水平。

模型选型这件事,每两个月该重做一次。9月第一周的重做清单只有一条:把“国产vs海外”的旧心智模型,换成“开源vs闭源”——后者才是2026年下半年真正决定账单的那条线。

EasyAPI这类聚合层的价值也在这:一个Key接入所有主流模型,无论是开源还是闭源,切换只改配置不碰业务代码。模型格局在变,但调用层可以保持稳定。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值