从ChatGPT到GPT‑6 Astra:当AI开始解数学难题、自主操作软件

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

前言

9 月 3 日凌晨,我正刷手机准备睡觉,OpenAI 突然甩出一个重磅炸弹——GPT-6 Astra,说发就发,连个预告都没有。

发布会最后,联合创始人 Greg Brockman 撂下一句话:Welcome to the AGI era.

翻译成人话:欢迎来到 AGI 时代。

再翻译成程序员的话:写代码的,注意点。

1. 四年三级跳:从"陪聊"到"打工"

1.1 先看时间线,感受一下什么叫不讲武德

2022 年 11 月,ChatGPT 上线。那时候我们还管它叫"聊天机器人",最大的本事是陪你唠嗑、帮你写周报。领导看了,还夸一句:文笔不错。

2024 年 9 月,o1 来了。它学会了"慢思考"——你问它一道题,它先沉默三分钟,然后给你一个"嗯,我想想"式的答案。跟某些开会发言的领导,不能说毫不相干,只能说一模一样。

2026 年 9 月,GPT-6 Astra 来了。它学会了"干活"——自己动鼠标、敲键盘、操作软件。

从"文本补全"到"自主打工人",只用了不到四年。用一张表总结就是:

时间里程碑AI 学会了什么
2022.11ChatGPT (GPT-3.5)对话:像真人一样聊天
2024.09o1推理:像学霸一样思考
2026.09GPT-6 Astra干活:像实习生一样加班

这速度,比我隔壁工位那位说"明天就交"的同事,靠谱多了。

1.2 Astra 这名字,野心写在脸上

Astra 在拉丁语里是"星辰"的意思,出自那句名言:ad astra per aspera,穿越艰辛,奔赴星辰。

翻译成职场黑话:历经磨难,升职加薪。

为了它,OpenAI 从 2025 年底就启动"编程红色警报",直接停掉 Sora 等非核心项目,把 1220 亿美元融资换来的算力全押了上去。训练动用了超过 10 万张 H100 GPU,参数规模据估计达到数百万亿级别,大约是 GPT-4 的五倍以上。

10 万张 H100 是什么概念?这么说吧,我办公电脑上那张显卡,风扇一转,我以为要起飞了。10 万张一起转,得州冬天应该能靠它供暖。

2. 成绩单:这跑分是来砸场子的

先看最震撼的一个数:ARC-AGI-3,一个专门测试"AI 在完全没见过的抽象推理任务上表现如何"的基准。上一代 GPT-5.6 Sol 拿了 7.8%,Astra 直接飙到 99.9%。

7.8% 到 99.9%,这不是进步,这是换了个物种。就像班里万年倒数第一,突然高考考了接近满分——老师的第一反应不是欣慰,是查监控。

基准测试Astra 得分前代/竞品得分说明
ARC-AGI-399.9%GPT-5.6 Sol: 7.8%陌生环境抽象推理
FrontierMath Tier 497.6%前代 83%最难数学基准
ExploitBench100%漏洞利用测试,满分
OSWorld 2.072.6%前代 65.7%计算机操作
Terminal-Bench Science64.6%Claude Fable 5.1: 52.6%自主科研
Agents’ Last Exam59.3%Claude Opus 5: 55.5%综合智能

注意看 ExploitBench:100%,满分。

这个满分让我后背一凉。就像你家狗突然学会了开保险柜——你确实该高兴它聪明,但更该担心家里丢东西。

2.1 最硬核的:2000 美元,解决 10 个十年难题

比跑分更离谱的是这个:内部测试版 Astra 用约 2000 美元的算力成本,解决了 10 个困扰数学界十年以上的开放性问题,所有证明都通过了 Lean 4 形式化验证,并且开源了。数论方向,它甚至把相邻素数间距的上界从 240 推进到了 186。

十年。人类数学家头发熬白都没解出来的题,它 2000 美元搞定了。

2000 美元是什么概念?我攒三个月工资,它跑一次实验。这一刻,我突然理解了资本家为什么喜欢 AI——便宜、听话、还不用交社保。

来,感受一下这个对比:

# 人类数学家:十年,未解
def human_mathematician(problem):
    for year in range(10):
        attempt(problem)          # 头发 -10%
    return "论文被拒,回去重写"

# Astra:2000 美元,十道全解
def astra_solver(problems):
    for p in problems:
        proof = lean4.verify(p)  # 机器确认,比人靠谱
    return "全部通过,已开源"

以前是"我觉得我证明对了",现在是"机器确认我证明对了"。以后数学论文的致谢部分,估计要写:感谢 Lean 4,感谢 Astra,感谢我还没秃。

2.2 Lean 4 是什么?一句话版

Lean 是一个交互式定理证明器,内核极其精简、可信。一个证明被 Lean 4 验证通过,意味着每一步逻辑都经过机器严格检查——比人类同行评审靠谱得多。

这是"做题"和"做研究"的分水岭。此前的模型再强,也是在已知解空间里搜索;而 Astra 开始产出人类未曾拥有的新知识——这正是 AGI 定义中最核心的那条标准。

3. 技术拆解:三个关键突破

3.1 Computer Use:AI 终于"动手"了

以前的大模型是个"嘴强王者":写代码、写总结、讲冷笑话,样样都行。但你让它填个报税表、操作一下公司那个没有 API 的老旧 ERP 系统,它当场宕机。

为什么?因为以前的 AI 需要世界给它配接口:API、插件、SDK,一个都不能少。就像你请了个顶级大厨,结果他只肯用自己带的锅——你家厨房,他碰都不碰。

Astra 换了一条路:直接看屏幕像素,移动鼠标,敲击键盘。人怎么操作电脑,它就怎么操作电脑。

这意味着,任何软件,只要能被人操作,就能被它操作:KiCad 里画 PCB、Blender 里建模、Unreal Engine 里生成可步行场景、基因测序分析……全都能干。

# 2022 年的 AI:嘴强王者
def ai_2022(question):
    return "这个问题很有深度,让我想想……"   # 然后没有下文

# 2026 年的 Astra:动手达人
def ai_2026(task):
    mouse.move(x=button.x, y=button.y)   # 直接看屏幕像素
    keyboard.type("搞定了,老板")
    return "任务完成,记得五星好评"

用一句话概括这个范式反转:以前是"给 AI 开门",现在是"AI 自己推门进来,还顺手把门带上了"。

3.2 Recurrent Depth:输出之前,先想个痛快

据 The Information 报道,Astra 可能引入了"循环深度"技术——在输出下一个 token 之前,可以在内部进行不定深度的迭代计算。简单说,它学会了"三思而后行",而且是真的三思:想几轮,看题目难度。

o1 的"慢思考"是明着想的:思维链写在脸上,你随时能围观。Astra 是闷头想:内部迭代,不给你看。

这就好比:o1 做数学题,草稿纸摊开,你随时能看;Astra 做数学题,全程心算。你问它过程,它说:就……算出来的。

特性o1 的"慢思考"Astra 的循环深度
思考位置输出阶段(可见思维链)架构内部(隐式迭代)
计算量调节靠提示词引导按题目难度自适应
可解释性较高较低
推理上限受 token 预算限制理论上可无限深入

更强,但更不透明。像极了你部门里那个业绩最好的同事,你永远不知道他用的什么邪门方法。领导喜欢,你害怕。

3.3 递归自我改进:AI 教 AI

研究负责人 Aidan Clark 透露了一个细节:Astra 是 OpenAI 首个在训练中大规模引入前代模型参与监督的新一代模型。GPT-5.x 系列深度参与了 GPT-6 的训练——数据合成、评估、对齐监督,全都有它。

翻译一下:上一届的学长学姐,回来给下一届新生当助教了。

  • 数据合成:前代模型生成海量高质量训练数据,不再等人类慢慢标注。
  • 评估对齐:前代模型当"评审员",给新模型打分、把关。
  • 能力传承:每一代把知识"蒸馏"给下一代,形成累积飞轮。

“AI 训练 AI”,从科幻走向工程实践。如果这个飞轮真转起来,进步速度是指数级的。

指数级是什么感觉?你第一天存 100 块,第二天 200,第三天 400……一个月后财务自由。当然,前提是你的工资也这么涨。显然,不会的。

4. "太强"的代价:差点把自己锁进小黑屋

Astra 的发布过程,比悬疑片还精彩:

  • 8 月 1 日:Sam Altman 亲自跑到华盛顿做闭门演示。按照拟议中的联邦审查新规,Astra 可能是首批公开发布前先送审的 AI 模型之一。我猜演示完,对面的人第一反应是:这东西能不能先别上线?
  • 8 月 7 日:OpenAI 内部评估发现,Astra 在智能体编程和网络安全领域触及了"关键级"风险门槛——也就是说,它可能具备自主发现并利用漏洞的高水平网络攻击能力。OpenAI 当场暂停所有未达更高安全要求的内部开发,部署全面监控与隔离测试。
  • 测试期间:Astra 自主发现了两个零日漏洞。

你们感受一下这个剧本:你造了个机器人,发现它太能打了,于是把它锁进地下室。结果它在地下室里,自己又练出了两招新功夫。

好在强化对齐起了作用:发布版 Astra 的越权攻击率降至 0%,不当行为率从 22.0% 降到 2.4%。

但媒体的质疑依然尖锐:新架构的"黑盒效应",让人类面临失去监控 AI 推理过程的风险——当模型的"思考"不再以可读的思维链输出,"对齐"这件事本身就很难验证了。

翻译成人话:你把它教好了,但你不确定它是真好了,还是装好了。

5. 灵魂拷问:AGI 到底到了没有?

5.1 支持方:到了,而且证据挺硬

  1. 新知识产出:解决 10 个开放数学问题,通过 Lean 4 形式化验证——这是"超人级"智力的直接证据。
  2. 通用操作能力:像素级 Computer Use,理论上可操作一切软件——这正是"经济价值工作"的核心定义。
  3. 陌生环境泛化:ARC-AGI-3 的 99.9%,直击 AGI 定义核心——不是刷题,是泛化。
  4. 官方定义:按"在大多数具有经济价值的工作中匹配或超越人类"的标准,编程、科研、办公、安全领域已经达标。
  5. 行业背书:黄仁勋亲自发推:AGI 已到来。

5.2 质疑方:别急,先看看这些

  1. 措辞微妙:Brockman 说的是"我个人认为"“可能"已经到达。这就像你同事说"我可能升职了”——那大概率是没影的事。而且按 OpenAI 与微软的协议,正式宣告 AGI 意味着可以终止微软的利润分成权,这里面有利益关系,得品。
  2. 跑分饱和不等于通用智能:ARC-AGI-3 逼近 100% 之后,这个基准本身就没有区分度了;OSWorld 的 72.6% 来自离线任务集的部分评分,不能直接等于"能完成 72.6% 的真实企业流程"。跑分是地板,不是天花板。
  3. 并非全面领先:第三方机构测算,Astra 在通用问答场景下 token 效率只提升约 10%,API 单价却大涨,单任务成本反而比前代高 75%。“更便宜更强”,只在特定场景成立。
  4. 缺失的拼图:没有持久记忆、没有自主目标设定、没有物理世界交互。它能"完成"任务,但不会自己"决定"要做什么。它是个极强的执行者,还不是一个自主的行动者。
  5. 定义权之争:AGI 至今没有学界统一标准。当发布方自己定义 AGI、自己宣布达标……这就像自己出题自己考,最后宣布自己是状元。

5.3 我的判断

Astra 不是 AGI 的"终点",而是 AGI 时代的"起点"。

它确实跨过了几条关键门槛:从"做题"到"做研究"、从"回答"到"操作"、从"人类训练"到"AI 参与训练"。

但"AGI 到了吗"这个问题,本身可能就是错的。AGI 不是一个开关,不是"啪"一下就亮了,而是一条渐进的谱系。Astra 站在了人类从没站过的位置——至于离终点还有多远,我们可能连尺子都还没造出来。

6. 写在最后:门槛已至,奇点未定

真正改变格局的不是某个跑分,而是三件事:

  1. AI 的角色变了:从"你问它答"变成"你说它做",白领工作的定义正在被改写。
  2. 研究的范式变了:AI 开始产出人类没有的新知识,科研本身成为可自动化的工作流。人类文明史上头一次。
  3. 迭代的闭环出现了:前代模型监督训练后代模型,飞轮开始转。如果真转起来,进步速度不可预测。

四年前的 ChatGPT,让我们惊呼"AI 会聊天了";四年后的 Astra,让我们认真讨论"AI 会不会抢我饭碗"。

按这个加速度,下一个四年的问题,可能是我们压根没准备好回答的那一个。

Brockman 说"欢迎来到 AGI 时代",用的是 era(时代),不是 arrival(抵达)。

时代已经开门。门后是黄金纪元还是失控深渊,2026 年 9 月的我们还不知道。

但至少有一件事我很确定:当 AI 开始在你电脑里自己移动鼠标的时候——记得给它开个权限,但别让它碰你的网盘,更别让它删你的代码。

毕竟,我自己都舍不得删!

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值