打开OpenRouter周榜,前10名里挂着5个中国名字——Hy4 preview、GLM 5.3 Flash、DeepSeek V4 Flash 0731、MiMo-V2.5、DeepSeek V4 Flash 0423,加起来吃掉了一半的token流量。中国模型在Top10中合计占比约71.6%。
这个数字背后,是9月第一周发生的三件事,把“国产模型能不能用”这个旧问题直接换成了“为什么还要用闭源”。
训练成本砍到了十分位
9月2日,阿里发Qwen3.8-Max-0902,2.4T参数MoE、1M上下文,在CodeArena WebDev跑出1691分——压过Claude Opus 5的1688分。同份发布里披露了一行数据:训练成本约是Qwen3.7-Plus的九分之一。
9月10日,DeepSeek上V4.1 Flash,把对HBM的需求降到上代的1/4,SSD降到1/8,KV缓存压缩至每token 890字节。同样的智能水平,对硬件的胃口小了一个数量级。定价直接落到0.02元/百万Token(缓存命中),输出4元。
训练成本降一个数量级,推理成本降一个数量级——这才是价格能持续走低的结构性原因。
协议从“非商用限制”切到了MIT
8月底,智谱把GLM-5.3-Flash(320B参数、原生多模态、综合智能指数57)以MIT协议开源。之前GLM系列多带限制性条款,MIT的意思是:你下载权重、商用、改写、不必公开衍生品。
它在Artificial Analysis综合智能指数中拿到57分,与Claude Opus 4.8最高档得分持平。配上OpenRouter渠道价,比DeepSeek V4 Flash 0731还便宜一半。
Hugging Face 2026年春季报告的数据更直观:中国自研开源模型全球下载占比41%,首次超过美国的36.5%。
闭源那边把价格战打到缓存层
Anthropic 9月1日把Claude Fable 5.1的缓存读取价从1.00美元砍到0.25美元/百万Token——降75%,输入输出仍维持10/50美元的高位。Anthropic测算典型场景有效成本下降25%、Agent工作负载下降45%。
同期Sonnet 5涨价被取消,2/10美元正式永久。海外厂商的策略很明确:让“未缓存输入”看起来贵,让“缓存读”便宜到开发者主动去设计缓存。
三条正反馈循环第一次跑通
三件事组合起来,解释了OpenRouter榜单的变化。中国厂商把训练成本压到原来的零头、定价就有了空间;MIT协议让下游愿意集成、调用量就上来了;流量越大、推理成本越低、再让利给开发者——这条正反馈循环第一次在中国模型上跑通。
对独立开发者来说,三件事要更新进选型清单
第一,“国产=跑分强但难落地”该丢掉了。 GLM-5.3-Flash综合智能指数57、超过Qwen3.7-Plus和Claude Opus 4.6;Qwen3.8-Max在WebDev榜单是真跑分。
第二,“开源=弱”也站不住了。 MIT协议+极低的OpenRouter渠道价+1M上下文,这套组合在大多数业务场景里已经够用。
第三,“闭源=稳”剩下的价值是SLA、合规、企业集成,不是基础智能水平。
模型选型这件事,每两个月该重做一次。9月第一周的重做清单只有一条:把“国产vs海外”的旧心智模型,换成“开源vs闭源”——后者才是2026年下半年真正决定账单的那条线。
EasyAPI这类聚合层的价值也在这:一个Key接入所有主流模型,无论是开源还是闭源,切换只改配置不碰业务代码。模型格局在变,但调用层可以保持稳定。

1440

被折叠的 条评论
为什么被折叠?



