🎬 视频版直达:https://www.bilibili.com/video/av117255459377360/
💡 今日趋势速览:OpenAI API疑似泄露GPT-6 Sol,发布或比预期更早;马斯克坦承Grok 4.7强化学习调优不当,仍需数天完善;月之暗面趁势全量上线Kimi K2.8-Preview并开放1M上下文,编码能力直逼K3。巨头密集亮剑,新一轮模型大战一触即发。
🎯 今日要点
📋 今日内容汇总
🤖 AI动态
- OpenAI API 疑似泄露 GPT-6 Sol 模型
- 马斯克透露 Grok 4.7 尚需几天完善
- Kimi K2.8-Preview 全量上线,全员可用 1M 上下文
- DeepSeek 撤销下线计划,V4 Pro API 将继续提供
- 月之暗面 8 月 ARR 破 10 亿美元,Kimi K3 拉动增长
- Devin Fusion 发布,多模型协作降低编码智能体成本
- 美安全公司用 AI 发现微信漏洞,造出零点击蠕虫 WeWorm
- 商汤开源 SenseNova-U1.5:8B-MoT 统一多模态模型
- Genspark 发布 PPT 专用模型 Gen-1 Slides
- FLUX Video Edit 上线 OpenRouter,一句话改视频
- Cursor 发布私有基准 CursorBench 4.0
- Cursor 推出 Projects,让 Agent 管理 Agent
- MiniMax H3 上线 ModelScope Civision 平台
- 腾讯推出终端智能体 T1:强化学习练长程任务
- NASA 与 IBM 发布月球科学开源基础模型
- 音乐生成模型 YuE2 免费公开,性能接近 Suno 5
- Sakana AI 发布 Fugu Max:以编排模型池换韧性
🧪 芯片半导体
🦾 机器人具身智能
📌 模型排行榜
🤖 AI动态
1. OpenAI API 疑似泄露 GPT-6 Sol 模型
OpenAI 的新模型 GPT-6 Sol 疑似出现在其 API 中,被外界解读为发布临近的信号。此前市场预计 Sol 会在 DevDay 上亮相,但此次泄露显示其可能比预期更早推出,引发业界对 OpenAI 下一步模型迭代节奏的广泛关注。

🔗 https://x.com/Mr_Salio/status/2098099145764745489
马斯克透露 Grok 4.7 还需要几天时间完善。他表示团队在强化学习中可能对回复长度的惩罚过于严苛,或存在其他问题,导致模型在面对本可以完成的高难度任务时过早放弃,且在自我核查工作上尚未足够严谨。

🔗 https://x.com/elonmusk/status/2098462085973741960
3. Kimi K2.8-Preview 全量上线,全员可用 1M 上下文
来源:原文 | Max For AI (Twitter)
Kimi发布K2.8-Preview,Kimi Code和Kimi Work全量上线,官方称综合性能接近K3。此次编码和Agent能力全面提升,思考效率优于K2.7 Code,全部会员可用最高1M上下文此外,原有kimi-for-coding直接升级为K2.8 Preview,Model ID不变,用户无需重新配置,新模型还支持图片和视频输入。



🔗 https://x.com/MaxForAI/status/2098325009521582418
4. DeepSeek 撤销下线计划,V4 Pro API 将继续提供
来源:原文 | Max For AI (Twitter)
DeepSeek 改口:官方通知称 9 月 14 日后仍会继续提供 V4 Pro API,价格不变,此前计划的自动切换 V4.1 Flash 取消。两天前其刚宣布 V4.1 Flash 全面超过 V4 Pro,计划下线 Pro 并将 deepseek-v4-pro 请求自动转至 V4.1 Flash,如今两日内撤回。


🔗 https://x.com/0xLogicrw/status/2098380992113517053
5. 月之暗面 8 月 ARR 破 10 亿美元,Kimi K3 拉动增长
彭博社消息,月之暗面(Moonshot AI)告知投资者,受 Kimi K3 发布推动,其 8 月 ARR 突破 10 亿美元,远高于 6 月的 3 亿美元;公司目标 2026 年底前将 ARR 提升至 20 亿美元,实现数倍增长,K3 被视为收入跃升的主要动力。

🔗 https://www.techmeme.com/260911/p11#a260911p11
6. Devin Fusion 发布,多模型协作降低编码智能体成本
Artificial Analysis 在 Devin Fusion 发布当日完成独立测试:这是首个纳入其编码智能体指数的多模型编码智能体,在保持 Claude Fable 5.1 和 GPT-6 Astra 性能的同时降低成本。Devin Fusion 由 Cognition 提供,让前沿领先模型搭配高性价比助手模型协同。


🔗 https://x.com/ArtificialAnlys/status/2098504936984293447
7. 美安全公司用 AI 发现微信漏洞,造出零点击蠕虫 WeWorm
《纽约时报》报道,美国安全公司Calif用AI研究微信时,在VoIP通话模块发现内存破坏漏洞此事最早发生在今年7月,7月23日研究团队披露相关进展。分析人士称,微信蠕虫实验为中国的AI风险敲响了巨大警钟,促使相关方面更急于与美国对话。


🔗 https://x.com/MaxForAI/status/2098471493873381666
8. 商汤开源 SenseNova-U1.5:8B-MoT 统一多模态模型
商汤 SenseNova-U1.5 上线 Hugging Face 并开源:原生统一的 8B-MoT 多模态模型,无需视觉编码器或 VAE 即可实现视觉理解、推理与生成,原生支持 4K 分辨率,权重与代码以 Apache 2.0 许可在 GitHub 的 OpenSenseNova 开放。

🔗 https://x.com/HuggingPapers/status/2098325919152959854
9. Genspark 发布 PPT 专用模型 Gen-1 Slides
来源:原文 | LinuxDo 前沿快讯
Genspark 发布 PPT 专用模型 Gen-1 Slides,基于 MiniMax M3 开放权重、与 Fireworks AI 联合后训练,已成为 Genspark AI Slides 标准模式默认模型。制作 PPT 需内容组织、页面生成、渲染检查和反复修改,单日生成量最高 12 万套,模型以最终交付质量为强化学习目标。

🔗 https://wallstreetcn.com/livenews/3163655
10. FLUX Video Edit 上线 OpenRouter,一句话改视频
来自 @bfl_ai(Black Forest Labs)的 FLUX Video Edit 现已在 OpenRouter 上线。用户发送一段视频和一句话,即可移除或替换物体和角色、更换场景、重新设定风格,或翻译对白并匹配口型,全程无需遮罩与逐帧控制,把视频编辑简化成一条自然语言指令。

🔗 https://x.com/OpenRouter/status/2098441690801656232
11. Cursor 发布私有基准 CursorBench 4.0
SWE-bench 等公开基准被刷爆后,Cursor 更新发布私有基准 CursorBench 4.0。结果显示 Claude Fable 5.1、Opus 5 贵但确实最强;GPT-6 Astra 不参与评测;Grok 4.6 表现不突出,和 Muse Spark 1.3 相比优势不大且更贵;Lee 表示 Grok 4.7 会有很大提升。

🔗 https://x.com/shao__meng/status/2098203246246629560
12. Cursor 推出 Projects,让 Agent 管理 Agent
Cursor 推出 Projects:用户与一个协调 Agent 在单一持久会话中协作,由它拆解任务、制定计划,再分派给大量子 Agent 并行执行;项目长期保存代码库与偏好,任务默认云端运行,需要时可拉起本地 Agent。

🔗 https://x.com/cursor_ai/status/2098162488013455784
13. MiniMax H3 上线 ModelScope Civision 平台
MiniMax H3 现已上线 ModelScope Civision,提供免费的视频推理和训练:用户既能免费生成视频,也能免费发起训练。依托 ModelScope 平台托管,开发者和创作者无需自备算力即可试用与定制这一视频模型,视频生成模型的实验和微调门槛进一步降低。

🔗 https://x.com/ModelScope2022/status/2098248494842564931
腾讯推出终端智能体 T1:基于 122B 总参数、10B 激活的 MoE,经强化学习训练操控真实 Linux 终端,单任务可连续 300 多轮工具调用。Terminal-Bench 2.1 得分从基线 43.8% 经 SFT 升至 64.0%,Long-Horizon 版本达 27.9%。


🔗 https://x.com/Yucheng__Shi/status/2098276024324886709
NASA 与 IBM 联合发布面向月球科学的开源基础模型,基于月球勘测轨道器约 200 万张图像切片训练,并融合 GRAIL、Lunar Prospector 与 JAXA SELENE 的地形和重力数据。模型已在 Hugging Face 开放,可用于陨石坑识别等月球科研任务。

🔗 https://x.com/v_shakthi/status/2098369032076587457
16. 音乐生成模型 YuE2 免费公开,性能接近 Suno 5
音乐生成模型 YuE2 免费公开:日媒 gigazine 称其性能接近付费的 Suno 5,支持从乐谱生成歌曲并可合成日语人声。YuE2 为开放发布但许可证禁商用,社区反馈实际质量与 Suno 尚有差距,ComfyUI 已宣布支持。

🔗 https://x.com/gigazine/status/2098381118147867046
17. Sakana AI 发布 Fugu Max:以编排模型池换韧性
Sakana AI 正式发布Fugu Max与Fugu Ultra v2两款模型,编排迄今规模最大的开放与专用模型池具体来看,Fugu Max以低至六分之一的成本实现与顶尖模型几乎不相上下的性能背后逻辑是,最强AI系统不是孤立巨头,而是协作生态,编排无需在成本与能力之间取舍,让两者同时向前迈进。



🔗 https://x.com/hardmaru/status/2098240407947673868
🧪 芯片半导体
18. 台积电 1.4nm 厂最快 2027 年 4 月试产,提前约一年
Wccftech 报道称,台积电位于台中的 1.4nm 半导体工厂计划 2027 年 4 月启动试产,量产目标 2027 年下半年,较原定 2028 年提前约一年。新厂位于台中二期扩建园区,2025 年 10 月动工,整体规划 4 座厂房,正加快建设进度。

🔗 https://www.ithome.com/1/001/245.htm
🦾 机器人具身智能
19. AGIBOT 发布 GE-Act 2.0,首个原生世界动作模型
AGIBOT 发布 GE-Act 2.0,首个验证具身智能预训练与扩展路径的原生世界动作模型:从零在具身数据上训练,不继承视频生成器、不做任务微调,真机零样本测试覆盖未见场景与物体、100 个原子任务、20 个技能类别、两种机器人。

🔗 https://x.com/AGIBOTofficial/status/2098372932372476021
📌 模型排行榜
20. Artificial Analysis AI 模型能力排行榜
最后是今日的 AI 模型能力排行榜单,智力榜头部呈双雄并列:Claude Fable 5.1 (max with fallback) 与 GPT-6 Astra (max) 同以53分并列第一,Claude Opus 5 (max) 以51分居第三。开源阵营表现亮眼,GLM-5.3 (max) 以45分位列第7,Kimi K3 (max) 以44分紧随其后排名第9。

🔗 https://artificialanalysis.ai/
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

706

被折叠的 条评论
为什么被折叠?



