🎬 视频版直达:https://www.bilibili.com/video/av117204758829279/
💡 今日趋势速览:谷歌6周内第3次更新,发布Gemini 3.8 Flash与安全版Flash Cyber,主打漏洞检测。Meta随后推出Muse Spark 1.3,工具调用与token消耗双降。同时GPT Astra两个检查点现身测试,巨头们围绕效率与安全加速内卷。
🎯 今日要点
📋 今日内容汇总
🤖 AI动态
- 谷歌发布 Gemini 3.8 Flash 与 Flash Cyber
- Meta 发布 Muse Spark 1.3,主打智能体与编码任务
- GPT Astra 新检查点测试中:含发布候选与安全变体
- 探测称 gpt-6-astra 真实存在,为类 cyber 的变体
- 阿里发布Qwen3.8-Max-0902,参数达2.4万亿
- 美团 LongCat-2.0 在 Cline 免费开放使用
- 西班牙 Multiverse 发布 Quasar 438B 推理模型
- Claude 新增后台操作电脑能力,可代人点击输入开应用
- Claude Commerce Agents 开源:购物与商家智能体蓝图
- 蚂蚁集团开源 UI-Venus-2 通用 GUI 智能体
- MiniMax H3 Max 上线 OpenRouter,更快更便宜
- Perplexity 开源本地推理引擎 Lily,专攻 Apple 芯片
- 月之暗面:Kimi API 兼容 OpenAI 与 Anthropic 接口
- Fal 发布 H3 Max Turbo 预览版:速度翻倍成本减半
- H3-World:将 MiniMax-H3 直接改造为世界模型
📌 模型排行榜
🤖 AI动态
1. 谷歌发布 Gemini 3.8 Flash 与 Flash Cyber
谷歌发布Gemini 3.8 Flash及安全版Flash Cyber,这是6周内第3个Flash版本。Cyber面向防御者,主打漏洞检测与修补。新模型定价每百万token输入0.75美元,当天全渠道上线并登陆Antigravity平台,Arena排名升6位。


2. Meta 发布 Muse Spark 1.3,主打智能体与编码任务
Meta 发布 Muse Spark 1.3效率方面,对比上一代1.2,工具调用次数减少约20%,token消耗减少约25%。基准测试中在第三方Artificial Analysis智能指数中,Muse Spark 1.3以61分跻身前列,与GPT-5.6 Sol并列,领先DeepSeek等多款模型。



3. GPT Astra 新检查点测试中:含发布候选与安全变体
有测试者发现,两个 GPT Astra 检查点 ultima-alpha 与 vega-alpha 正在测试:前者疑似面向公众发布的候选版本,后者是专注网络安全的变体,供部分企业用于安全工作。实测显示,Astra 确实专为长时间运行的任务与编排而打造。

4. 探测称 gpt-6-astra 真实存在,为类 cyber 的变体
探测者称gpt-6-astra已在OpenAI API上预置上线,Responses API对它返回404 Not Found。分析指出gpt-5.7并不存在,sol、terra、luna、cyber等端点全部返回400,注册slug返回404正是受限的表现。因此astra是变体,类似gpt-5.6-cyber,在5个端点上与cyber字节级一致,而cyber是已发布但受限的模型。



5. 阿里发布Qwen3.8-Max-0902,参数达2.4万亿
阿里发布升级版大模型Qwen3.8-Max-0902,拥有2.4万亿参数和100万上下文标记定价方面,该模型每百万token输入2美元、输出6美元,缓存命中成本低至0.17美元。此外,经编码与协作方向进一步训练,多项评测成绩超越前代,模型现已通过QwenCloud API上线。


6. 美团 LongCat-2.0 在 Cline 免费开放使用
编码智能体 Cline 宣布,美团的 LongCat-2.0 现已免费提供。这是一个 1.6T 参数的开放权重 MoE 模型,支持 1M 上下文,评测表现与 Claude Opus 4.7、Gemini 3.1 Pro 相当。用户安装 Cline 后用 /model 命令切换即可调用。

7. 西班牙 Multiverse 发布 Quasar 438B 推理模型
西班牙公司 Multiverse Computing 发布首个大模型 Quasar 438B:4380 亿参数的推理模型,支持 1M 上下文,主攻企业级 Agent 与编码。Artificial Analysis 独立实测给出 43 分,高于 Mistral Medium 3.5 的 30 分,成为榜单中得分最高的欧洲模型,但与全球前沿仍有差距。

8. Claude 新增后台操作电脑能力,可代人点击输入开应用
Claude 官方宣布,Claude 现可在 Claude Cowork 与 Claude Code 中后台操控用户电脑:给它一个桌面任务后,它会像本人一样完成点击、输入与打开应用等操作,用户可同时继续处理其他工作,无需独占屏幕。

9. Claude Commerce Agents 开源:购物与商家智能体蓝图
Anthropic 面向开发者开源 Claude Commerce Agents,将其定位为构建购物与商家智能体的蓝图,覆盖零售、旅行、电信与娱乐等领域,并提供对应的参考实现,帮助开发者在此基础上快速搭建自己的电商场景 Agent。以下是官方给出的 demo

10. 蚂蚁集团开源 UI-Venus-2 通用 GUI 智能体
蚂蚁集团发布通用GUI智能体UI-Venus-2,将移动端、网页端与桌面端控制统一到单一端到端模型,并已在Hugging Face开源9B与27B两档检查点。多项基准测试显示,该模型在VenusBench-Mobile、WebVoyager、OSWorld-Verified等评测中领先多个主流模型,并具备规模化训练环境与基于关键点的验证机制。


11. MiniMax H3 Max 上线 OpenRouter,更快更便宜
MiniMax H3 Max 现已上线 OpenRouter,定位比 H3 更快、更便宜。相同提示词的并排对比显示:约 30 秒即可完成就绪,而原版需要约 3.5 分钟;单个片段的费用也从 0.65 美元降到 0.40 美元,生成成本与等待时间同步下降。以下是官方给出的 demo

12. Perplexity 开源本地推理引擎 Lily,专攻 Apple 芯片
Perplexity 宣布开源本地推理引擎 Lily。它为 Perplexity Computer 的混合计算而构建,专门针对 Apple 芯片上的 Qwen3.6-35B-A3B 模型优化,目标是让设备端推理足够快,不会成为 Computer 任务的瓶颈,相关代码现已公开。

13. 月之暗面:Kimi API 兼容 OpenAI 与 Anthropic 接口
月之暗面宣布,Kimi API已支持OpenAI Responses API与Anthropic Messages API,Codex、Claude Code等编码工具可通过自定义模型供应商直连kimi-k3等模型官方同时提醒,Responses API目前仅支持文本与图片,暂不支持视频。桌面客户端的模型选择器可能显示为自定义,实际使用的是Kimi K3等模型。


14. Fal 发布 H3 Max Turbo 预览版:速度翻倍成本减半
Fal 发布视频模型 H3 Max Turbo 预览版,速度翻倍、成本减半,官方称评估中力争达到原 H3 Max 质量的第 97 百分位,仍优于 H3 等所有视频模型。促销价下 768p 视频输出每秒仅 0.01 美元,提示理解与美学表现保持不变。

15. H3-World:将 MiniMax-H3 直接改造为世界模型
研究团队公开 H3-World,称其为首个将 MiniMax-H3 本身转化为世界模型的成果:无需新增动作模块,直接把 H3 预训练获得的语言理解能力转化为世界控制能力,整个微调仅使用 8K 样本与 0.199% 的可训练参数。以下是官方给出的 demo

📌 模型排行榜
16. Artificial Analysis AI 模型能力排行榜
智力榜由Claude Fable 5.1以66分登顶,Claude Opus 5 (63分)、Muse Spark 1.3 (62分)紧随。智能体榜同款Fable 5.1以61分居首,Muse Spark 1.3、Claude Opus 5与GLM-5.3同以59分并列其后。开源阵营亮点在GLM-5.3,智力榜第9名60分,智能体榜并列第4名59分,双榜均衡。


以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。


被折叠的 条评论
为什么被折叠?



