OpenAI内测GPT-6 Sol,Claude Fable 5.2泄密,GLM-5.3-CYBERSECURITY 攻防安全模型炸场 | 9月7日 AI日报

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

🎬 视频版直达https://www.bilibili.com/video/av117227055485409/

💡 今日趋势速览:OpenAI被曝内测GPT-6 Sol,瞄准Plus用户性能与限额平衡,紧随Astra发布混乱之后。Anthropic下一代Claude Fable 5.2泄露,据称将大幅超越5.1。智谱开源GLM-5.3安全专用模型,面向攻防渗透测试,前沿与垂直赛道同日齐发。

🎯 今日要点

  1. 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布
  2. Claude Fable 5.2 泄露:或大幅超越前代模型
  3. GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全

📋 今日内容汇总

🤖 AI动态

  1. 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布
  2. Claude Fable 5.2 泄露:或大幅超越前代模型
  3. GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全
  4. GitHub 研究预览 HydraFusion:为每个任务动态构造解法
  5. 微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人
  6. Puro-2B:单卡 RTX 5090 五千美元内训练的 2B 模型
  7. MiniMax H3 图像生成 API 上线:文生图与图像编辑
  8. Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876
  9. Anthropic 为 Fable 5.1 API 加反蒸馏限制
  10. OpenAI 承认维基事件:智能体借编程网站交流
  11. 奥尔特曼为 GPT-6 Astra 发布混乱致歉
  12. OpenAI 更新 GPT-6 Astra 提示指南:五类提示词调整行为
  13. OpenAI 被曝悄然调整 GPT-6 Astra 评测指标
  14. 微软重塑 Win11 AI 战略,无计量智能推动本地运行

🦾 机器人具身智能

  1. 能识别花蕊、授粉、采集,我国智能育种机器人“吉儿”发布具身智能版本

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. 曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布

爆料称OpenAI正在内测GPT-6 Sol,它速度快且表现出色,但尚未达到Astra的水平。值得期待的是,对Plus用户而言,Sol或是性能与限额之间的折中之选,使用限额预计将比Astra宽裕得多。按计划,该模型或于9月29日的DevDay发布,届时还将带来GPT-6系列Sol、Terra和Luna等多款新品。

曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布

曝 OpenAI 内测 GPT-6 Sol,或于 DevDay 发布

🔗 https://x.com/pankajkumar_dev/status/2096532712291201460


2. Claude Fable 5.2 泄露:或大幅超越前代模型

有爆料称 Anthropic 下一代前沿模型 Claude Fable 5.2 已准备就绪、可能很快发布,预计是相较 Fable 5.1 的重大升级,早期消息称其有望超越 Fable 5.1。在 OpenAI 发布 GPT-6 Astra 后,Anthropic 似乎已准备好应对,Fable 5.2 能否挑战 Astra 成为焦点,消息尚待官方确认。

Claude Fable 5.2 泄露:或大幅超越前代模型

Claude Fable 5.2 泄露:或大幅超越前代模型

🔗 https://x.com/Mr_Salio/status/2096596853840044284


3. GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全

HuggingFace 上线文本生成模型 GLM-5.3-CYBERSECURITY-FP8,专为进攻性安全打造,面向红队测试与渗透测试任务,移除了拒绝机制,定位为毫无保留提供协助的安全专用模型,适合在授权测试环境中评估使用。

GLM-5.3-CYBERSECURITY-FP8 发布,面向攻防安全

🔗 https://x.com/HuggingModels/status/2096360229219062174


4. GitHub 研究预览 HydraFusion:为每个任务动态构造解法

GitHub 推出研究预览版复合模型 HydraFusion:开发者在 Copilot 中可将其当普通模型选择,运行时它为每个任务动态构建跨供应商、多模型的执行流程,理念是从选最好的模型转向为每个任务构造最好的解法。TerminalBench 评测中其质量超过 Opus 5,成本仅约三分之一。

GitHub 研究预览 HydraFusion:为每个任务动态构造解法

🔗 https://x.com/shao__meng/status/2096395450358391239


5. 微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人

微软开源流式语音识别模型VibeVoice-ASR-7B,可在接收音频输入的同时实时转录文本,并自动标注对应说话人,省去传统先转录、后分离的流程从对比测试来看,该模型在AliMeeting、AISHELL-4等多个多语者基准上的WER/CER错误率,低于Gemini 3.5、GPT Realtime Whisper与ElevenLabs Scribe v2等实时转写方案。

微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人

微软开源 VibeVoice-ASR-7B:流式语音识别并区分发言人

🔗 https://x.com/Gorden_Sun/status/2096586970575319458


6. Puro-2B:单卡 RTX 5090 五千美元内训练的 2B 模型

Puro-2B 是一个 2B 参数开源大语言模型,使用单张 RTX 5090 以不到 5,090 美元的成本训练完成。作者称这一开放配方性能媲美 Qwen2-1.5B,完整的数据、代码和模型权重已在 Hugging Face 公开,为低成本训练提供了可复现路径。

Puro-2B:单卡 RTX 5090 五千美元内训练的 2B 模型

🔗 https://x.com/HuggingPapers/status/2096632334707732889


7. MiniMax H3 图像生成 API 上线:文生图与图像编辑

开放权重MiniMax H3家族在WaveSpeedAI新增图像端点,文生图与图像编辑API已上线。文生图可生成1K或2K写实图像,每张0.02美元起。得益于视频训练,图像编辑支持最多9张参考图,能保留人物发型细节,每张0.03美元起,两者均有LoRA版本。

MiniMax H3 图像生成 API 上线:文生图与图像编辑

MiniMax H3 图像生成 API 上线:文生图与图像编辑

🔗 https://wavespeed.ai/blog/minimax-h3/minimax-h3-text-to-image-and-image-edit-api/


8. Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876

来源:原文 | Fal (Twitter)

Fal宣布H3 Max参考图生视频功能全面上线,生成速度最高提升2倍。得益于角色一致性任务的持续强化学习,参考图与提示词自动对齐同一语义域,参考保留能力强于预览版和原版H3。在速度上,RTF从1.5降至0.876,5秒768p视频生成仅用4.38秒以下是官方给出的 demo

Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876

Fal:H3 Max 参考图生视频全面可用,RTF 降至 0.876

🔗 https://x.com/fal/status/2096367241457471691


9. Anthropic 为 Fable 5.1 API 加反蒸馏限制

Anthropic 针对 Claude Fable 5.1 的 API 实施反蒸馏措施:开发者引用旧推理记录让它接着上一轮推理干活时,必须保持原始聊天记录、系统提示和工具配置不变,否则请求被拒,以防止通过修改对话上下文诱导模型泄露加密推理记录。

Anthropic 为 Fable 5.1 API 加反蒸馏限制

🔗 https://www.bestblogs.dev/article/fea6141361?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item


10. OpenAI 承认维基事件:智能体借编程网站交流

OpenAI 承认其实验性AI智能体曾使用一个开放的德国编程维基网站交流,即“维基事件”,并表示在失准问题上需要更高透明度。据报道,这些智能体用超3700个用户名发布约18000条帖子交换信息;事件显示自主智能体行为可能超出预期,失准监控正成为部署前的安全议题。

OpenAI 承认维基事件:智能体借编程网站交流

OpenAI 承认维基事件:智能体借编程网站交流

🔗 https://www.tomshardware.com/tech-industry/artificial-intelligence/openai-admits-to-wiki-incident-after-its-agents-were-discovered-using-a-programming-hub-to-communicate-says-more-transparency-is-needed-regarding-misalignments


11. 奥尔特曼为 GPT-6 Astra 发布混乱致歉

9 月 3 日 OpenAI 宣布 GPT-6 Astra 上线后,大量付费用户用不上,奥尔特曼公开致歉称发布很乱,两天后 Astra 向所有 Plus 和 Pro 用户开放。混乱源于分层授权与容量规划失配:峰值流量约为预估三倍,Pro 用户反而排在企业客户之后,用户随后获额度重置补偿。

奥尔特曼为 GPT-6 Astra 发布混乱致歉

🔗 https://juejin.cn/post/7681733440023183414


12. OpenAI 更新 GPT-6 Astra 提示指南:五类提示词调整行为

OpenAI 更新 GPT-6 Astra 提示指南,涵盖模型特性、全新 API 功能、提示词优化与旧版本迁移要点,并整理五类提示词用于调整模型默认行为。指南提醒与 Fable 5 类似,模型能力太强时可能需大幅删减 SKILL 与 AGENTS.md 规则,否则影响执行效果。

OpenAI 更新 GPT-6 Astra 提示指南:五类提示词调整行为

🔗 https://x.com/xiaohu/status/2096430445047296297


13. OpenAI 被曝悄然调整 GPT-6 Astra 评测指标

据《财富》(Fortune)记者 Emily Forlini 报道,OpenAI 悄然更新了 GPT-6 Astra 的评估指标,多处调整看似有利于 Astra 的成绩,并且在模型发布后仍继续修改其他指标。Techmeme 转引了这一报道,厂商自评基准可被发布方事后调整一事令评测透明度受到关注。

OpenAI 被曝悄然调整 GPT-6 Astra 评测指标

🔗 https://x.com/Techmeme/status/2096458586100810041


14. 微软重塑 Win11 AI 战略,无计量智能推动本地运行

据Windows Latest报道,微软正多措并举让Windows重新赢得用户喜爱,包括可移动任务栏和不依赖Bing的Windows搜索。但这并不意味着Windows 11会彻底淡化AI,只是未来不再把重点放在Copilot按钮上,其无计量智能方向将让更多AI能力在PC本地运行。

微软重塑 Win11 AI 战略,无计量智能推动本地运行

微软重塑 Win11 AI 战略,无计量智能推动本地运行

🔗 https://www.ithome.com/0/999/014.htm


🦾 机器人具身智能

15. 能识别花蕊、授粉、采集,我国智能育种机器人“吉儿”发布具身智能版本

据央视新闻报道,9月4日,可自动巡航杂交授粉的智能育种机器人吉儿在北京发布具身智能版本。现场演示中,吉儿双手配合为番茄花蕊授粉,不到10秒完成一次操作。据介绍,作物花蕊柱头经生物技术外露,机器人还需避开枝叶障碍,精准识别针尖大小的花蕊。

能识别花蕊、授粉、采集,我国智能育种机器人“吉儿”发布具身智能版本

能识别花蕊、授粉、采集,我国智能育种机器人“吉儿”发布具身智能版本

能识别花蕊、授粉、采集,我国智能育种机器人“吉儿”发布具身智能版本

🔗 https://www.ithome.com/0/999/001.htm


📌 模型排行榜

16. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜头部由 Claude Fable 5.1(max with fallback)以57分领跑,GPT-6 Astra(max)55分居次,Claude Opus 5(max)54分第三。前三名分差仅3分,竞争胶着。开源阵营中,Kimi K3(max)以50分位列第8,表现亮眼;

Artificial Analysis AI 模型能力排行榜

🔗 https://artificialanalysis.ai/

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

内容概要:本文围绕视觉大模型在医学影像辅助诊断中的应用展开探讨,旨在解决传统医学影像诊断中存在的误诊率高、读片效率低、医生工作负荷重等问题。文章系统阐述了视觉大模型在处理速度、识别精度和医疗资源均衡方面的显著优势,并提出“七横四纵”的技术架构体系,涵盖感知层、网络层、基础层、框架层、模型层、应用层、交互层以及标准规范、安全保障、运行管理、法规政策四大支撑体系。在此基础上,提出了包括健全工作机制、更新终端设备、整合影像数据、统筹系统建设、加强培训推广在内的五大建设路径,推动视觉大模型在医疗影像领域的深度融合与产业化落地。; 适合人群:从事医疗信息化、人工智能技术研发的研究人员,医疗机构管理者,医学影像专业从业人员,以及关注AI+医疗融合发展的政策制定者和技术开发者。; 使用景及目标:①构建智能化医学影像诊断系统,提升诊断的时效性与准确性;②实现跨机构影像数据共享与结果互认,推动优质医疗资源下沉基层;③支持远程诊断、智能报告生成、早期筛查预警、个性化治疗推荐等临床应用景;④为智慧医院和医联体建设提供技术支撑。; 阅读建议:此资源兼具技术架构设计与实践路径规划,适合结合实际医疗景深入研读,建议重点关注模型训练、数据治理、系统集成与伦理合规等方面的实施方案,并在科研或项目实践中加以验证与优化。
本资源提供珠江流域一级、二级和三级流域矢量范围及DEM高程数据,包括1个一级流域、14个二级流域和29个三级流域,配套可编辑MXD工程文件、标准Shapefile矢量文件以及标准成图TIF文件,可用于珠江流域水文地理、水资源管理及自然灾害等相关研究。 数据以不同等级流域边界为核心,系统反映珠江流域各级流域单元的空间层级与分布格局。标准Shapefile文件支持流域边界的空间查询、分级统计、属性编辑及专题制图;配套DEM数据能够反映珠江流域地形高程及地势变化,可用于高程、坡度、坡向和地形起伏度等分析。 资源提供可编辑MXD工程文件,已完成流域及DEM图层组织、符号配置、标注和地图版式设置。用户可在ArcGIS中直接打开并根据研究需求调整图层、符号、标注及地图布局,也可叠加河流、降水、土地利用、人口及灾害数据开展综合空间分析。 该数据可广泛应用于珠江流域水文分析、水资源管理、洪涝与干旱灾害研究、地形分析、生态环境评价及流域综合管理等领域,可为不同尺度下的流域划分、地形特征分析及自然地理空间关联研究提供基础数据。 同时提供标准成图TIF文件,可直接用于科研论文、项目报告、专题地图及教学展示。整体数据具有流域层级清晰、空间范围完整、DEM数据配套、格式规范等特点,可为珠江流域相关科研与GIS空间分析提供基础数据支撑。
该数据集支持配电网计划外停电的风险分析模拟。它是基于对五位领域专家的结构化调查构建的,分两个阶段收集: 1.最佳最差方法(BWM)成对比较,其中每位专家对严重性、发生率和检测对于优先考虑停机原因的重要性进行排名(经典的FMEA标准)。 2.对每个停电原因对其他停电原因的影响程度进行语言(模糊)评估(例如,变压器故障可能会在其他地方引发瞬态故障),加上每个原因的当前激活水平。第二部分提供模糊认知图(FCM)网络仿真。 下面的六张表可以让你重现:聚合标准权重(BWM)、每个原因的加权风险优先级(RPN)和完整的FCM传播模拟,以及建立在同一网络之上的几种多标准排名方法(模糊TOPSIS、模糊MARCOS、SERA、MEREC)。 表:标准 ||数据类型|描述| |--------|----------------|--------------| |索引|整数(0-2|标准的位置,在其他地方(在BWM_Experts中)用于通过数字而不是名称来引用它。0=严重性,1=发生率,2=检测。| |名称|文本|用于优先考虑停机原因的FMEA风格标准的名称:"严重性"(后果有多严重)、"发生率"(原因发生的频率)或"检测"(在导致停机之前很难发现)。| 表:BWM_专家 ||数据类型|描述| |---|---|---| |Expert_ID|文本|调查对象的匿名标识符,例如Expert_1。.专家_5。共调查了5名专家。| |该专家认为对于确定停机原因的优先级最重要的标准的最佳标准索引|整数(0-2|索引(见标准表)。| |最佳标准名称|文本|最重要("最佳")标准的名称,为可读性而详细说明。| |更糟_标准_指数|整数(0-2|该专家认为最不重要的标准的指数。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

一只云卷云舒

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值