OpenAI 发布 GPT-6 Astra:ARC-AGI-3 拿下 99.9%,首个触及网络安全 Critical 级的模型

9 月 3 日晚,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra(API 模型名 gpt-6-astra)。总裁 Greg Brockman 在媒体简报会上称其为“世代能力跨越”(generational leap),甚至表示回顾几年后,人们可能会认为 AGI 就是在这个时候、关于这个模型诞生的——发布以一句“Welcome to the AGI era”收尾。

一、成绩单:多项基准刷新纪录

OpenAI 官方公布的核心数据相当抢眼:

  • ARC-AGI-3:99.9%(官方基准口径),全面超越此前保持 SOTA 两天的 Claude Fable 5.1,且价格更低
  • FrontierMath Tier 4 v2:97.6%
  • ExploitBench:100%
  • GPQA Diamond:96%、DeepSWE v1.1:74.1%、BenchCAD:95.9%
  • OSWorld V2-Offline:72.6%(上一代 GPT-5.6 Sol 为 65.7%),真实桌面任务平均耗时从约 75 分钟降至 40 分钟

官方还给出一个很有画面感的数字:Astra 以 Lean 形式化证明的方式解出了 10 道十年未解的数学与理论计算难题,单次解题 Token 成本约 2000 美元。

二、定位:一台“能替你操作电脑”的模型

首席研究官 Mark Chen 介绍,Astra 能构建和测试软件、跨应用操作电脑、尝试开放科学问题。OpenAI 的宣传语非常直白:“凡是你在电脑上能完成的事,Astra 都能快速替你完成。”职场自动化比例从上一代的 18% 提升到 41%,未防护越权率则从 48% 压到了 0%。

规格方面,Astra 提供 1,050,000 token 上下文窗口、128,000 最大输出 token,知识截止日期为 2026 年 4 月 30 日。API 定价为每百万输入 10 美元、每百万输出 50 美元,与 Claude Fable 5/5.1 持平。

三、首次触及网络安全 Critical 红线

这可能是本次发布中最值得警惕的部分:OpenAI 同步公布了安全概览,称 Astra 是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型——可以在没有逐步引导的情况下,自主发现防护严密系统中的未知安全漏洞并开发利用方式。

也正因为如此,Astra 初期仅向经过审核的 Daybreak Access 计划组织开放,ChatGPT Pro 和 Business 订阅率先获得推送,未来几天内陆续覆盖 Plus、Enterprise、API 及 AWS Bedrock。

四、几点冷静的注脚

  • ARC-AGI-3 的分数口径存在差异:最初报告为 98.6%(reported),后续官方基准显示 99.9%,且 ARC 基准官方提示该成绩与排行榜上传统前沿模型的对比“并不直接”,阅读时需要留意。
  • 也有第三方评论指出,在带工具的综合测试上 Astra 仍落后于 Claude。
  • “AGI 时代到来”更多是 Brockman 的个人判断,是否算 AGI,他自己也说“留给用户判断”。宣传与实际能力之间的距离,还需要跑一段时间才能看清。

值得一提的是,Astra 的命名取自拉丁语 ad astra,意为“奔赴群星”。这次训练据称动用了德州 Stargate 场地超过 10 万张 GPU,是 OpenAI 迄今最大规模的训练运行。

资料来源:OpenAI 官方博客、The Verge、Simon Willison、IT之家、TestingCatalog 等(经 AI HOT 聚合,事件时间线);原文:openai.com/index/gpt-6-astra。具体数字请以官方原文为准。

腾讯云精选福利

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注