DeepMind试刀Nano Banana 2.5,xAI开放X给Grok Bot,Kimi Work上线远程控制 | 9月10日 AI日报

🎬 视频版直达https://www.bilibili.com/video/av117244487079860/

💡 今日趋势速览:DeepMind在Image Arena实测Nano Banana 2.5,进步显著但未胜OpenAI,巨头图像模型竞争升温。xAI向Grok Bot开放X平台并附赠100美元API积分,加速生态扩张。月之暗面为Kimi Work上线远程控制,手机随时掌控任务,Agent向移动化演进。

🎯 今日要点

  1. DeepMind 图像竞技场测试 Nano Banana 2.5
  2. xAI 开放 X 平台给 Grok Bot,附赠 $100 API 积分
  3. Kimi Work 上线远程控制功能

📋 今日内容汇总

🤖 AI动态

  1. DeepMind 图像竞技场测试 Nano Banana 2.5
  2. xAI 开放 X 平台给 Grok Bot,附赠 $100 API 积分
  3. Kimi Work 上线远程控制功能
  4. GPT-6 Astra 限时上线 Arena 直接测试
  5. vLLM 0.28.0 发布:大幅提升 Kimi K3 性能
  6. OUI-1:首个开源权重的生成式 UI 模型
  7. Suno 发布 v6:与 WMG、BMG 合作训练
  8. ChatGPT 语音可用 GPT-5.6 Sol、GPT-6 Astra
  9. 苹果发布新一代 Apple AI:支持 16 种语言
  10. DeepMind 开放 AlphaGenome 基因突变预测库
  11. Cohere 开源 Megakernel:比 vLLM 快 1.58 倍
  12. 腾讯发布统一语音生成与编辑模型 AuK
  13. LingBot-World 2.0 发布:1.3B 模型实时生成世界
  14. 蚂蚁 Ling VL 与 Gander 智能体上线 Hugging Face

🦾 机器人具身智能

  1. 小米机器人开源具身世界模型 U0 的 4B 版本

🌐 科技公司

  1. 苹果发布首款折叠屏手机 iPhone Duo

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. DeepMind 图像竞技场测试 Nano Banana 2.5

Google DeepMind 正在 Image Arena 测试新一代图像模型 Nano Banana 2.5,代号 spicy-mayo。实测者称其较上代显著进步,但未明显优于 OpenAI 的 GPT-Image 2.5,尤其在依赖世界知识的生成任务上仍有差距,头部图像模型的竞争目前仍处于胶着状态。

DeepMind 图像竞技场测试 Nano Banana 2.5

🔗 https://x.com/synthwavedd/status/2097720011229950297


2. xAI 开放 X 平台给 Grok Bot,附赠 $100 API 积分

xAI 宣布向 Grok Bot 开放 X 平台:接入即自动开通开发者账号,附赠 100 美元 API 积分。X 可作为连接集成接入 Grok Bot Marketplace,让 Grok Bot 直接读写 X 数据。发帖者称这是自己用得最多的插件,可让 Grok Bot 监测发帖趋势、对比同类帖子。

xAI 开放 X 平台给 Grok Bot,附赠 $100 API 积分

🔗 https://x.com/shao__meng/status/2097476011365679394


3. Kimi Work 上线远程控制功能

来源:原文 | ai_for_success

月之暗面宣布 Kimi Work 上线远程控制(Remote Control)功能:让 Kimi Work 在电脑上保持运行,即可随时随地用手机掌控任务进度,离开桌面也不中断。官方以随时随地、用 Kimi Work 工作概括这一定位,桌面端与移动端场景进一步打通。以下是官方给出的 demo

Kimi Work 上线远程控制功能

🔗 https://x.com/Kimi_Moonshot/status/2097636366544937067


4. GPT-6 Astra 限时上线 Arena 直接测试

Chatbot Arena 宣布限时开放:用户可在 Direct Mode 下拉菜单中选择 OpenAI 的 GPT-6 Astra 直接测试。GPT-6 Astra(Medium)将在未来 24 小时、即太平洋时间 9 月 10 日上午 8 点前于 Direct Mode 开放,此后继续在 Battle 和 Agent Mode 中可用。

GPT-6 Astra 限时上线 Arena 直接测试

🔗 https://x.com/arena/status/2097705919102771517


5. vLLM 0.28.0 发布:大幅提升 Kimi K3 性能

vLLM 发布 0.28.0:大幅提升 Kimi K3 推理性能,引入解码上下文并行,并为投机解码加入自适应验证。官方博客已放出 0.28 更新说明,下一场社区会议定于 10 月 1 日,主题为 llm-d 语义分类器入门。

vLLM 0.28.0 发布:大幅提升 Kimi K3 性能

🔗 https://x.com/RedHat_AI/status/2097724703053951136


6. OUI-1:首个开源权重的生成式 UI 模型

来源:原文 | 橘鸦早报

OUI-1 是首个开源权重的生成式 UI 模型,基于 DiffusionGemma 微调,为 26B/A4B MoE 架构。它在 Generative UI Benchmark 上拿到 71.7%,是基座模型 13.0% 的 5.5 倍,并以少 8 倍激活参数击败 Gemma 4 31B 的 46.7%。以下是官方给出的 demo

OUI-1:首个开源权重的生成式 UI 模型

🔗 https://x.com/shao__meng/status/2097479009286451524


7. Suno 发布 v6:与 WMG、BMG 合作训练

来源:原文 | TechCrunch

AI 音乐公司 Suno 发布 v6,为与华纳音乐集团(WMG)和 BMG 合作训练的新一代模型系列。Suno 宣布模型被使用时将向唱片公司和出版商支付版税,消息由彭博社报道,合作加版税分成使其成为 AI 音乐版权合作的标志性发布。

Suno 发布 v6:与 WMG、BMG 合作训练

🔗 https://x.com/Techmeme/status/2097630082898812992


8. ChatGPT 语音可用 GPT-5.6 Sol、GPT-6 Astra

来源:原文 | athyuttamre

OpenAI 更新 ChatGPT 语音模式:用户可自选任意模型和推理力度,Pro 用户可选 GPT-5.6 Sol 或 GPT-6 Astra;语音模式在需要搜索或推理时将调用所选模型完成任务,语音对话由此获得旗舰模型能力。

ChatGPT 语音可用 GPT-5.6 Sol、GPT-6 Astra

🔗 https://x.com/athyuttamre/status/2097761052939125132


9. 苹果发布新一代 Apple AI:支持 16 种语言

来源:原文 | IT之家 (ITHome)

苹果在本次发布会推出新一代 Apple AI,计划支持英语、简体中文、繁体中文等 16 种语言,简繁中文均列入名单。但页面右下角小字显示,Apple AI 首发不支持在中国大陆使用,当地用户需等待后续开放。以下是官方给出的 demo

苹果发布新一代 Apple AI:支持 16 种语言

苹果发布新一代 Apple AI:支持 16 种语言

🔗 https://x.com/fxtrader/status/2097743631579042028


10. DeepMind 开放 AlphaGenome 基因突变预测库

来源:原文 | 思维怪怪 (Tech) (Twitter)

Google DeepMind 发布 AlphaGenome 人类基因突变数据库。人类 DNA 约含 30 亿碱基对(ACGT),仅变异一个碱基也会产生 90 亿种组合;DeepMind 用 AI 模型提前算完这 90 亿种变异的影响,整理成数字图谱免费开放学术界,并推出 AVI 指标衡量变异影响预测质量。

DeepMind 开放 AlphaGenome 基因突变预测库

DeepMind 开放 AlphaGenome 基因突变预测库

🔗 https://x.com/Gorden_Sun/status/2097605341928182077


11. Cohere 开源 Megakernel:比 vLLM 快 1.58 倍

Cohere开源推理系统Megakernel,为North Mini Code模型打造,性能最高比vLLM快1.58倍。该系统decode阶段的前向计算由一个常驻GPU的持久kernel完成,不再逐算子启动kernel。官方数据显示,单张H100、BF16精度下达成这一成绩,为开源推理栈的decode提速提供了新思路。

Cohere 开源 Megakernel:比 vLLM 快 1.58 倍

Cohere 开源 Megakernel:比 vLLM 快 1.58 倍

🔗 https://x.com/shao__meng/status/2097467097970552993


12. 腾讯发布统一语音生成与编辑模型 AuK

腾讯发布统一语音生成与编辑模型 AuK:单一自然语言界面即可完成零样本 TTS、基于指令的内容/声学/副语言编辑,以及语音增强与分离。官方同时推出蒸馏版 AuK-Flash,运行速度提升 4.5 倍,更适合低延迟在线语音场景。

腾讯发布统一语音生成与编辑模型 AuK

🔗 https://x.com/HuggingPapers/status/2097660279626609134


13. LingBot-World 2.0 发布:1.3B 模型实时生成世界

LingBot-World 2.0 系列发布:Small 为 1.3B 参数模型,可在消费级单张 GPU 上实时生成世界;Bidirectional 是用于蒸馏更小、更快领域模型的高质量源模型;Causal Pretrain 为后训练、评估与适配的核心基座。官方称新版更易于运行和研究。以下是官方给出的 demo

LingBot-World 2.0 发布:1.3B 模型实时生成世界

🔗 https://x.com/robbyant_brain/status/2097708105585107418


14. 蚂蚁 Ling VL 与 Gander 智能体上线 Hugging Face

蚂蚁 Ling VL 模型携手首发合作伙伴 Novita Labs 登陆 Hugging Face 开放体验;同场开源的全模态交互智能体 Gander 也在同一模型中统一了全模态感知、全双工语音交互与智能体执行,现已同步上线 Hugging Face。以下是官方给出的 demo

蚂蚁 Ling VL 与 Gander 智能体上线 Hugging Face

🔗 https://x.com/AntLingAGI/status/2097732934417649711


🦾 机器人具身智能

15. 小米机器人开源具身世界模型 U0 的 4B 版本

小米机器人在Hugging Face发布小型具身世界模型,为U0的40亿参数版本,采用Apache 2.0开源协议。此外该模型还提供用于建模连续交互的序列变体,可刻画机器人与环境多步交互的动态演化,面向具身智能研究与世界模型训练场景。

小米机器人开源具身世界模型 U0 的 4B 版本

小米机器人开源具身世界模型 U0 的 4B 版本

🔗 https://x.com/AdinaYakup/status/2097673190952603980


🌐 科技公司

16. 苹果发布首款折叠屏手机 iPhone Duo

来源:原文 | 宝玉 (Twitter)

苹果发布首款折叠屏手机 iPhone Duo:外屏为 5.4 英寸,内屏为 7.6 英寸,搭载配备全新显示引擎的 A20 Pro 芯片,并支持 Touch ID(消息来自 9to5Mac)。这也是 iPhone 产品线首次引入折叠形态,苹果自此正式加入折叠屏手机市场。以下是官方给出的 demo

苹果发布首款折叠屏手机 iPhone Duo

🔗 https://x.com/Techmeme/status/2097751466400448893


📌 模型排行榜

17. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜头部呈双雄并列格局:Claude Fable 5.1(max with fallback)与GPT-6 Astra(max)同以53分并列第一,开源与国产阵营中,GLM-5.3以45分位列智力榜第7名,展现国产模型正快速逼近第一梯队。

Artificial Analysis AI 模型能力排行榜

🔗 https://artificialanalysis.ai/

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

一只云卷云舒

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值