你把一摞财务文件交给 AI,不只让它找数字,还让它逐项核对、标出问题、留下记录。过去,模型常能写出像样的答案,却未必能把一串操作可靠地做完。OpenAI 正式发布的 GPT-6 Astra,想把重点从“会回答”推向“能执行”:读材料、调用工具、修改内容、运行软件,再检查结果。
这也是为什么 Astra 值得现在看。它同时带来了三件事:一批接近满分、但需要仔细拆解的测试成绩;首次动用超过 10 万块 GPU 的预训练规模;以及 OpenAI 首个达到内部“关键级”网络安全能力的广泛部署模型。公司总裁 Greg Brockman 称,现在进入“AGI era”并非不合理。但 AGI——通常指能跨广泛领域完成复杂认知任务的通用人工智能——没有统一、可验证的行业判定标准。因此,这首先是 OpenAI 管理层的发布叙事,不是行业已经确认的结论。
本文数字多数来自 OpenAI 自报或单一转述,且部分评估使用了定制测试脚手架和最大性能设置。读跑分时,测试条件与分数同样重要。
最亮眼的 99.9%,到底测了什么?
Astra 最抢眼的成绩来自 ARC-AGI-3。这项测试把模型放进陌生、抽象的回合制环境,不直接告诉它目标。模型要主动探索,理解规则,设定目标,再规划和执行。可以把它想成第一次拿到一款没有教程的益智游戏:你得先试按键,观察反馈,然后归纳机关如何运作。
据 ARC Prize 公布的结果,Astra 使用 OpenAI 定制的 Provider Adapter harness 时得分 99.9%,成本约 1.9 万美元。Benchmark harness 是围绕模型搭建的测试脚手架,负责提示编排、工具调用和结果检查。这里的 Provider Adapter 还能跨请求保留不透明的推理状态,并压缩长对话,让模型重复利用此前工作。
换成 ARC Prize 的 Standard harness,Astra 得分是 62.7%,成本约 2.6 万美元。Standard harness 只允许模型携带自己选择保留的笔记。两种设置都创下该测试的领先成绩,但差距说明,99.9% 不能简写成底层模型无条件拿到近满分。它测到的是 Astra 与一套特定智能体系统组合后的能力。
测试回放仍揭示了一种值得注意的行为。Astra 会把陌生环境压缩成符号化的“小地图”:记录对象、坐标、规则和未完成计划,再用自己生成的简写规划动作。ARC Prize 还称,它在 96% 的关卡中比完成该关卡的人类中位数使用更少动作。这项行动效率结论目前是单一信源,而且“动作更少”不等于整体智能超过人类。
至于 FrontierMath Tier 4,材料中同时出现约 98%和 97.6%两种口径。该测试由 OpenAI 资助开发,OpenAI 还拥有部分独家访问权限,因此不宜把这个数字当作独立、无条件的能力认证。
规模变大,工作链也变长
OpenAI 研究人员 Aidan Clark 表示,Astra 的预训练首次使用德克萨斯州 Stargate 基础设施上的超过 10 万块 GPU。GPU 是训练大型模型所需的主要计算芯片。这个数字说明投入规模,但供稿没有披露训练时长、实际计算量或能耗,不能仅凭 GPU 数量推导训练效率。
产品层面的变化更容易被用户感知。官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token,并原生支持文本输入输出和图像输入。Token 是模型处理文字时切分出的基本单位;上下文窗口则是它一次能接收的对话、文档和代码总量。窗口更大,意味着能一次放进更多材料,但不保证模型能同样准确地利用每一处信息。
OpenAI 的“八针”长上下文测试提供了一点证据:据 Simon Willison 转述,Astra 在 256K—512K Token 区间得分 100%,在 512K—1M 区间得分 96.3%。不过,这仍是 OpenAI 自设测试的单一转述,需要在真实任务中复核。
专项任务也显示,Astra 更擅长把生成、运行和检查串起来。OpenAI 报告称,它在 DeepSWE v1.1 的 113 项软件工程任务中得分 74.1%,GPT-5.6 Sol 为 70.8%;在要求根据图片重建三维 CAD 程序的 BenchCAD Vision2Code 子集中,Astra 得分 95.9%,Sol 为 83.3%。Fable 5.1 的 84.3%使用了修改后的评估设置,不宜直接横比。
在 Terminal-Bench Science 0.1 的 70 个命令行科研任务中,OpenAI 报告 Astra 完成率为 64.6%,Fable 5.1 为 52.6%。这些成绩指向同一个方向:模型不只生成一段文字或代码,还尝试操作工具、执行程序并验证结果。不过,OpenAI 说明评估模型通常以最大性能运行,这可能增加延迟、Token 消耗和成本。
而在第三方 Artificial Analysis Intelligence Index 中,Astra 得分 61,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1 低 5 分。它并没有在所有综合评估中领先。这也提醒我们,“最佳模型”仍是 OpenAI 的宣传性判断,而不是统一结论。
AGI口号旁边,有一道安全闸门
本刊 9 月 3 日已经报道过,Astra 在发布前触发了 OpenAI 的“关键”网络安全能力门槛。这个门槛属于公司内部风险框架,用来启动更严格的训练、访问和发布措施;达到门槛不等于模型已经实施现实攻击。
据 OpenAI 的安全说明,Astra 是其首个在 Preparedness Framework 下达到 Critical 网络安全能力等级的广泛部署模型。它在 ExploitBench 得分 100%。这项测试考察模型能否针对已知漏洞构造可用的利用方式。更强的漏洞分析能力既能帮助防守,也会提高滥用风险。
据 Axios 报道,OpenAI 在 2026 年 8 月因无法排除 Astra 已达到“关键级”能力,暂停不符合更严格安全要求的部分内部活动、扩大测试并放慢发布。正式发布时,最强网络安全功能仍只向受信任测试者和获批组织开放。换句话说,OpenAI 一边使用“AGI时代”的宏大叙事,一边没有把最敏感能力完全开放。
Astra 目前是分批 rollout——即逐步开放,而非所有用户同时可用。它先向部分机构推出,并计划在未来几天覆盖 ChatGPT Plus、Pro、Business、Enterprise、OpenAI API 和 AWS。发布、开始推送与每位用户已经获得访问权,是三种不同状态。
为什么这次发布值得关注?
Astra 的意义不在某一张跑分表,而在三个变化同时发生。
第一,模型开始在陌生环境中形成简洁的内部规则,并把探索、规划和执行连起来。第二,训练规模迈过 10 万块 GPU,但性能提升并非所有评估都一致。第三,网络攻击能力已经强到改变发布节奏和访问权限。能力、成本与治理不再是三条分开的新闻,而是同一个产品决策。
因此,“AGI口号落地”更准确的理解,不是宣布 AGI 已经实现,而是这句口号第一次被一组可操作的现实问题追上:模型能连续完成多少工作,用户要为此付出多少成本,系统脚手架贡献了多少能力,以及哪些功能不能直接交到所有人手里。
局限与未知
- 99.9% 的 ARC-AGI-3 成绩依赖定制 Provider Adapter harness;Standard harness 为 62.7%。两者不能混写,更不能据此宣布实现 AGI。
- 多数性能数字由 OpenAI 自报,模型又以最大性能运行。不同 harness、推理强度和评估设置,使跨模型比较存在偏差。
- 公开材料尚未说明十万块 GPU 对应的训练时长、计算量和能耗;长上下文、早期客户测试及真实使用中的稳定性,也仍待独立验证。