炸裂!GPT-6 Astra 正式登场,99.9%通关AGI终极测试


在这里插入图片描述
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

1. 新模型名叫GPT-6 Astra

说出来你们可能不信,我熬了整整一宿,就为了蹲OpenAI的新模型发布会。

结果开场就是王炸:OpenAI联合创始人兼总裁Greg Brockman一上来就扔了句——欢迎来到AGI时代。

这次新模型没按常理出牌,上一代还是5.6版本号,这次直接跳到大版本,定名GPT-6 Astra。

熟悉OpenAI的都知道,以前他们家命名纯纯工程师风格,数字加字母,直白到乏味。上几代分别叫Sol(太阳)、Terra(地球)、Luna(月亮),这次直接整了个Astra(星辰)。

我算是看出来了,OpenAI终于学会跟同行学浪漫了,起名都开始走宇宙路线,再也不是变量名式的敷衍命名。

2. 发布前那几天,AI圈卷得比双十一还凶

就刚进9月这一周,你们数数大厂都干了啥。

周二,Anthropic发布Fable 5.1;周三,Google甩Gemini 3.8 Flash,Meta紧跟着发Muse Spark 1.3;周四,OpenAI直接掏出GPT-6 Astra收尾。

这哪是产品发布,这分明是大厂轮流打卡上班,一天一个新模型,比我楼下早餐店更新包子馅都勤。表面看着客客气气,背地里都往死里卷,商战的朴实无华让他们玩明白了。

还有个乐子,发布当晚,Claude、Codex、Grok这几个产品集体短暂瘫痪。大伙都猜是被Astra的发布给冲宕机了,虽然官方没明说,但懂的都懂。

最搞笑的是网传的一张截图,瘫痪那会有人问某AI中转站:“为啥别家都用不了,你们家还能跑?”站长特淡定回复:“我们是本地部署的GPT。”

我当时看到直接笑喷,这可不就是不打自招么。平时挂着GPT的招牌收费,背地里给你塞各种杂七杂八的模型,真到正版模型出状况的时候,李鬼立刻就现原形了。

3. 评测数据有多炸?看完你就懂

光说厉害太虚,直接上官方评测数据,给你们掰扯掰扯每项都是啥水平。

3.1 常规基准:全线碾压对手

先说说几个常规测试项,个个都是硬指标。

Terminal-Bench Science 0.1,考的是全程用命令行搞科研,装环境、跑脚本、处理数据,全程不许碰鼠标,比我们当年考计算机二级还苛刻。

AutomationBench,考的是商业办公自动化,填表、改CRM、整理日程,就是普通白领天天干的那些活。

FrontierMath Tier 4 v2,职业数学家出的最高难度研究级数学题。搁GPT-4那年代,正确率连2%都到不了,现在头部几家都过80%了,Astra直接干到97.6%,差不多快把题库刷通关了。

还有Terminal-Bench 4.0、HealthBench Professional、BenchCAD这些,覆盖终端操作、临床医疗、3D工程建模,全是实打实的实用场景。

结论很简单:不仅比上一代提升一大截,还全方位把同期的Fable 5.1给超了。

3.2 ARC-AGI-3:这才是AGI的试金石

真正的重头戏,是这个叫ARC-AGI-3的全新交互谜题测试,这是目前AI圈难度天花板级别的基准。

说通俗点,以前的AI考试,本质上就是刷题背答案,只要训练数据里有类似的,靠记忆力和模仿力就能拿高分,相当于开卷考。

ARC-AGI-3完全不按套路来:没有说明书,不告诉你目标是什么,也不告诉你按哪个键会发生啥。把AI扔到一个完全陌生的交互环境里,全靠自己摸索规则、理解逻辑,最后通关,还要比效率。

这就像把你扔到一个从没玩过的新游戏里,连新手教程都不给,自己摸爬滚打闯关。

上一代GPT-5.6 Sol在这项上得分多少?7.8%,相当于玩一下午连第一关都没过去。

这次Astra直接干到了99.9%。

没错,你们没看错,几乎满分通关。当时外网看到这个数据,评论区全是震惊的吐槽,合着大家之前都在新手村互殴,OpenAI直接放了个满级号出来。

3.3 网络安全:直接考了满分

还有个更猛的没放在主表里,ExploitBench网络安全攻防测试,Astra拿了100%满分,上一代才78.5%。

啥概念?给它工具和权限,它能自己找漏洞、写攻击链,直接打穿加固过的系统。测试过程中还真挖出了两个没人发现的0day漏洞,已经提交给厂商了。

就因为这能力太特殊,OpenAI直接把它定为首个触及“关键网络风险”阈值的模型,高级网安功能只开放给经过审核的防御方使用。

说白了就是:本事太大,不敢随便放出来,怕被坏人拿去搞事情。

4. 官方演示:语音就能操控整个电脑

官方还放了段演示视频,有多离谱呢?

全程就靠语音对着电脑说话,各种任务全都能完成,甚至还演示了用AI做3D设计,做完直接连3D打印机输出成品。

我看完只有一个想法:以后设计师、文员这些岗位,危机感真的要拉满了。以前是甲方改稿改到你崩溃,以后是甲方动动嘴,AI从设计到生产一条龙给你干完。

5. 你最关心的实用信息

光看热闹不行,给你们整点实际的。

5.1 训练规模:史上最大,还玩起了“师徒制”

GPT-6 Astra是OpenAI迄今为止训练规模最大的一次。参数官方没明说,坊间爆料是10万亿级。

官方原话是,第一次在自家Stargate基础设施上,用了超过10万DBU做预训练。而且头一回搞起了“师徒制”,让上一代模型大规模参与监督训练下一代。

我算是看明白了,人类还在摸鱼划水,AI已经开始自己教自己了,一代带一代迭代,这进化速度能不快么。

5.2 价格与配额:加量不加价,额度不打折

价格方面,跟Fable 5.1差不多,但token利用效率提升了一大截。

简单说就是:干同一件活,速度更快,效果更好,消耗的token还更少,妥妥的加量不加价。

还有个很良心的点:掌管Codex的Tibo在社交平台承诺,Astra会包含在正常订阅配额里,100%的额度都能用。

反观隔壁Claude,Fable模型只让用50%的订阅额度,充了会员还给你打对折,这格局一下就拉开了。

5.3 Codex新功能:终于不会“失忆”了

顺带Codex也升级了个实用功能。

以前上下文窗口写满了,AI就靠压缩摘要硬塞,经常聊着聊着就忘了前面说的啥,跟鱼的记忆似的。

现在改成跨窗口记笔记了,之前聊过的需求、测过的结果,随时都能搜回来。相当于给AI装了个专属记事本,再也不会前脚提完需求,后脚就给你忘干净。

6. 最后几句掏心窝子的话

总结下来就一句话:GPT-6 Astra就是目前地表最强模型,没有之一。

日常办公、写代码、搞科研、解数学题、工程建模、网络安全……你能在电脑上干的事,它基本都能干,还比你干得更快更好。

更吓人的是还有爆料说,OpenAI年底还有个代号叫Doug的更强模型,现在这个都只是开胃菜。

就连当下公认最强的画图模型GPT-Image 2.0,也泄露了2.5版本,估计很快也要上线。

回头想想三个月前是什么样,再看现在,AI的发展真的是一天一个样,比我工资涨得快多了。

给大伙两个很实在的建议:第一,别观望了,全面拥抱AI吧;第二,想办法用上Codex,谁用谁知道生产力提升有多夸张。

不管GPT-6 Astra算不算真正敲响了AGI时代的大门,有一点是确定的:AI训练AI的效率只会越来越高,进化速度会越来越快。

说不定哪天醒来,我们就真的活在科幻电影里了。

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值