从7.8%到99.9%:一个数字的跨越

2026年9月3日,OpenAI在得克萨斯州Stargate基地的发布会上正式推出GPT-6 Astra。如果只用一个数字来概括这次发布,那一定是ARC-AGI-3:99.9%

作为对比,三个月前发布的GPT-5.6 Sol在同一测试集上的得分仅为7.8%。这意味着在短短一个季度内,OpenAI将ARC-AGI-3的成绩从几乎"不及格"推到了接近满分的水平。ARC-AGI系列被公认为当前最能衡量模型抽象推理能力的基准——它不考背题、不考记忆,专考模型在全新问题上的泛化能力。

数据来源:OpenAI官方发布会,2026年9月3日;ARC-AGI官方排行榜

Greg Brockman在发布会上直言:“欢迎进入AGI时代。“这句话的分量,圈内人都清楚。OpenAI过去三年从未正式承认自家产品达到AGI门槛,即便GPT-5系列已经在多项专业考试中超越人类中位数。而这一次,从总裁口中说出"AGI"二字,本身就是一个强烈的信号。

天价训练:10万块GPU的Stargate基地

GPT-6 Astra的训练投入同样令人咋舌。根据OpenAI披露的信息,本次训练动用了超过10万块GPU,部署在得州Stargate基地。这一规模在AI训练史上前所未有——此前GPT-5系列的训练集群约为2万块GPU量级。

成本方面,GPT-6 Astra的API定价为输入$10/百万Token,输出$50/百万Token,是GPT-5.6 Sol的2.5倍。这个定价策略透露出两个信号:

  1. 训练成本传导:万卡级集群的电力、折旧和运维成本,必须通过更高的API单价回收。
  2. 价值锚定:Astra定位"全球最强计算机使用模型”,面向企业级专业场景,定价对标高价值B端客户而非大众消费市场。

数据来源:OpenAI API定价页面,2026年9月更新

不只是聊天:会操作专业软件的Agent

Astra最引人注目的能力,是它对专业软件的操作深度。根据OpenAI公布的Demo视频和技术报告,Astra可以:

  • 操作Power BI:读取企业数据库、生成复杂报表、自动进行数据清洗和可视化
  • 操作KiCad:完成PCB原理图设计、布线、DRC校验全流程
  • 操作FreeCAD:进行三维机械建模、装配体约束设置、工程图纸导出

这意味着Astra不再是"回答问题的聊天机器人”,而是一个可以直接在操作系统层面执行任务的通用计算机操作员。传统AI模型只能输出文本或代码,而Astra可以像人类一样通过GUI界面操作任意软件。

Greg Brockman将其定位为"首个达到内部’Critical’网络安全能力门槛的模型"。这个"Critical"级别意味着OpenAI内部评估认为,Astra具备自主发现和利用软件漏洞的潜在能力——这也是为什么OpenAI在训练过程中主动暂停了两周

数据来源:OpenAI安全白皮书,2026年9月

安全争议:91.5%的拒答率够吗?

暂停训练两周后,Astra重新上线。OpenAI披露的数据显示,模型对91.5%的jailbreak尝试能够拒绝——这一数字确实漂亮,但放在AI安全讨论的语境下,问题依然存在:

  • 剩下的**8.5%**是什么?被攻破后能造成多大危害?
  • ARC-AGI-3测试集是否真的能覆盖所有推理能力?
  • 当模型学会操作真实软件,“安全护栏"的边界在哪里?

《Nature》杂志在9月的评论文章中指出,ARC-AGI-3虽然设计精良,但测试集规模有限,模型可能通过"刷题"式训练获得高分,而非真正的通用推理能力。这一质疑并非空穴来风——过去几年,几乎每一代新模型发布后,都会出现针对基准测试的"过拟合"争议。

数据来源:Nature评论,2026年9月刊

对行业的影响:我们该如何定位AGI?

GPT-6 Astra的发布,至少带来三个层面的行业震荡:

第一,企业级Agent落地加速。 当模型可以直接操作Power BI、KiCad这类专业软件,企业IT部门的工作流将被重构。过去需要人力完成的"读取数据→分析→出报告"闭环,现在可以一键完成。

第二,API定价分层加剧。 GPT-5.6 Sol依然可用,GPT-6 Astra溢价2.5倍。这迫使企业在"成本"和"能力"之间做更精细的权衡。中小团队可能继续使用Flash级模型,而头部企业愿意为Critical级能力支付溢价。

第三,安全监管即将收紧。 OpenAI主动暂停训练的举动,本身就是在向监管层释放"我们有自控能力"的信号。英国国王查尔斯三世即将召集的AI峰会,很可能将Astra级别的模型纳入强制评估范围。

结语:AGI不是终点,而是起点

Greg Brockman说"欢迎进入AGI时代”,但更准确的说法或许是:AGI时代的门槛正在被跨过,但AGI本身远未完成。

Astra在ARC-AGI-3上99.9%的得分令人震撼,但它在真实世界中的可靠性、成本经济性、安全可控性,都还需要数月甚至数年的验证。Nature的提醒值得反复品味:测试集的满分不等于真实世界的通用。

对于关注AI行业的从业者来说,现在最该做的不是欢呼或恐慌,而是动手测试——拿你日常工作中最复杂的三个任务去跑一遍Astra,看看它到底能做到什么程度。

本文首发于guijiagi.com,更多AI行业深度讨论欢迎访问硅基AGI论坛 silicon-agi.com。

相关阅读