文 | 字母 AI
Astra 发布前几个小时,AI 圈先乱成了一团。
9 月 3 日晚间,ChatGPT、Claude 和 Grok 几乎同时出现大范围服务异常,大量用户不是打不开模型,就是请求失败。
恰在此时,ChatGPT 官方账号在仰望星空:"The stars are almost aligned."(群星即将就位)

当然,这只是网友造的一个梗,目前没有证据表明这场故障与 Astra 有关。
但这个玩笑出现得恰逢其时——就在两天前,OpenAI 刚刚宣布,这款尚未正式发布的新模型已经成为公司第一个跨过 Preparedness Framework"Critical" 网络安全能力阈值的模型。
然后,群星真的 " 就位 " 了。
北京时间 9 月 4 日凌晨,OpenAI 正式发布 GPT-6 Astra。
但并没有全量上线。目前 Astra 只向少量 Trusted Access/Daybreak 体系中的机构和经过审核的网络安全用户开放—— Plus、Pro、Business、Enterprise 和 API 用户还要再 " 仰望 " 几天。

9 月 4 日,OpenAI" 对内 " 发布了 GPT-6 Astra。
目前,Astra 只向 Trusted Access / Daybreak 体系中的少量机构开放。OpenAI 表示,Plus、Pro、Business、Enterprise 订阅用户以及 API,将在未来几天陆续获得访问权限。
至于这个 " 几天 " 究竟是多少天,暂时没有更具体的时间表。
在发布前的闭门媒体简报会上,OpenAI 总裁 Greg Brockman 给了 Astra 一个相当夸张的注脚:"Welcome to the AGI era."
欢迎来到 AGI 时代。
OpenAI 研究副总裁 Aidan Clark 则从另一个角度解释了 Astra 为什么特殊:" 这是第一次在德州 Stargate 站点用超过 10 万张 GPU 做预训练,从数据中心网络到推理内核再到模型本身的形态,全部围绕这个训练规模从零设计 "。
Aidan 同时表示,Astra 也是 OpenAI 第一款让旧代际模型深度参与训练过程的产品。
简单来说,训练下一代 AI 的人里,已经开始出现上一代 AI。
虽然它还远远算不上 "AI 自己训练自己 ",但模型已经进入了下一代模型的研发流程。
在前天 Anthropic 称 Fable/Mythos 5.1 是 " 目前世界上最先进的编码和知识工作模型 " 之后,今天,OpenAI 也把称 Astra 是 " 世界上最强、最对齐的模型 "。
基准测试方面,最吓人的数字,来自 ARC-AGI-3。
这是一个专门测试模型能否进入从未见过的 2D 环境,通过不断试错发现规则、完成目标的 Agent 基准。它不像传统考试那样考记住多少知识,而更接近于把 AI 丢进一个陌生游戏里,看它能不能自己摸清楚 " 这个世界怎么运转 "。
Astra 在 OpenAI 自己的 Provider Adapter 配置下,最高拿到了 99.9%。
但这个数字需要拆开看。ARC Prize 还使用了一套所有厂商都可以统一比较的 Standard harness。在这里,Astra 最高只有 62.7%。

接上这套生产系统之后,Astra 从 62.7% 跳到了 99.9%,而且在双方都成功完成的任务中,Provider Adapter 整体运行速度约快 3.66 倍,token 消耗还减少了 49%。
某种意义上,挺像开外挂的。
在高难度数学方面,FrontierMath Tier 4 为 97.6%。FrontierMath 所处的 Epoch AI 表示,OpenAI 资助了该基准的开发,并对其部分题目拥有独占访问权。
值得关注的分数还有:
DeepSWE v1.1 74.1%
BenchCAD 95.9%
Terminal-Bench 科学任务 64.6%。

打开官网,案例几乎是一个接一个往下放。
KiCad、Excel、Blender、Power BI、浏览器填表、网站 QA;再到找房、找医生、预约 DMV、做税表、做 PPT、开发游戏、分析科研数据。
过去几代 GPT 发布,OpenAI 主要在告诉用户这个模型能回答什么;到了 Astra,它的重心似乎转了个向,变成了:你到底还有多少事情,可以直接交给 AI 去做。
OpenAI 甚至直接称 Astra 为 " 世界上最好的 computer use 模型 "。
模型在 " 用电脑 " 这件事上的进步,可能比分数更重要。在 Codex 里,Astra 带来了一套新的上下文机制:上下文窗口填满时不再只靠压缩摘要,而是可以跨窗口保留笔记、回搜更早的消息和工具输出。
Astra 还可以在某个问题悬而未决时,先继续做不依赖答案的部分,避免单个未决问题卡死整个任务。
当然,能力也直接写进了价格里。
GPT-6 Astra 的 API 标准价格是:每百万输入 token 10 美元,缓存输入 1 美元,输出 50 美元。
相比 GPT-5.6 Sol 目前的 4 美元输入、0.4 美元缓存和 20 美元输出,Astra 整档价格直接提高到了 2.5 倍。OpenAI 给它的定位也很明确:如果不知道该选什么旗舰模型,可以选 Astra;如果更在意成本,则继续使用 GPT-5.6 Terra 或者 Luna。
它仍然提供 105 万 token 上下文和最高 12.8 万 token 输出。但长上下文也有额外成本:和 GPT-5.6 系列一样,当单次输入超过 272K token 后,整次请求的输入费用会按 2 倍计算,输出则按 1.5 倍计算。
所以,OpenAI 其实给 Astra 独划出了一个更昂贵的智能档位。
如果只是问一个问题、改几段文案,花 2.5 倍价格未必值得。
但如果模型真能自己坐在电脑前,连续工作几十分钟甚至几个小时,把过去需要人来回切软件、查资料、填表格、改文件的一整件事情做完,那么真正该比较的,就不再只是每百万 token 多少钱了。
几个技术点,值得注意
Astra 还有几个技术点,或许比 Benchmark 本身更值得注意。
第一个是逆向工程。
OpenAI 在这次发布中引用了 SRE-Bench。这是 Columbia DAPLab 等团队今年推出的一套逆向工程基准:不给模型源代码,只给编译后的二进制程序,看它能不能重新理解程序逻辑、找到关键行为。
Astra 一次尝试的成功率达到 88.0%,最多四次尝试可以达到 99.2%。
同一套规则下,GPT-5.6 Sol 分别只有 55.9% 和 68.7%。

这对恶意软件分析、固件研究、漏洞挖掘和数字取证都有直接意义。
第二个变化,是 Astra 在超长任务里 " 不容易找丢东西了 "。
在 MRCR v2 八针检索测试中,Astra 面对 256K 至 512K 上下文时准确率达到 100%;到了 512K 至 1M token,仍然有 96.3%。而 GPT-5.6 Sol 在这两个区间分别只有 91.5% 和 73.8%。

Astra 则开始把 " 上下文窗口有多大 ",推进到了另一个更实际的问题:一个 Agent 到底能记住多长时间以前发生的事情。
对于需要连续工作几十分钟甚至几个小时的 Agent 来说,这可能比再增加几十万 token 窗口更重要。
除此之外,Astra 身上还有一个比较反常的变化。
它变得更对齐了,却也变得更难监控了。
OpenAI 公布的一组内部电脑使用安全测试中,Astra 的违规率从 Sol 的 22.0% 下降到了 2.4%;在专门观察模型是否会为了完成任务绕过限制的测试里,Astra 为 0%。内部幻觉测试也从 Sol 的 9.4% 下降到 Astra 的 2.0%。
至少按照 OpenAI 自己的测试,Astra 明显更少 " 乱来 "。但 OpenAI 首席科学家 Jakub Pachocki 同时提醒:" 智能的进步,并不保证对齐的进步。"

过去一种很重要的 AI 安全办法,是监控模型的思维链(Chain of Thought):如果模型准备越权、攻击某个系统或者偷偷改变目标,可以提前从它的推理里看到蛛丝马迹。
但 OpenAI 发现,Astra 对于自己的书面推理拥有更强的控制能力。一些过去必须写很多步才能解决的问题,它现在可以用更少的显式推理完成;如果模型知道自己的思考过程正在被监控,还会明显改变或者缩短这些内容。
因此,OpenAI 现在已经不能只盯思维链了。
为了盯住 Astra,不让它做出此前在 Sol 上出现的攻击行为,OpenAI 在生产环境里装上了 " 失对齐监控 "(misalignment monitoring)。它会同时观察模型的推理、实际动作、工具调用以及整条任务轨迹。
如果系统判断模型可能正在严重偏离用户原始意图,可以暂停甚至直接终止任务。
在 API 里,被拦截的任务可能直接结束;在 ChatGPT 或 Codex 里,一些情况下则会先让用户重新确认:
" 这真的是你想让我做的吗?"

OpenAI 还推出了 Fast 模式:价格翻倍,最高换来约 2.5 倍执行速度。
对于普通聊天,这可能没什么吸引力。但如果一个 Agent 原本要在浏览器和软件里跑 40 分钟,把时间缩到十几二十分钟,速度本身就会变成产品能力的一部分。
订阅侧,Astra 会包含在现有订阅额度里;Pro、Business 和 Enterprise 还会获得能力更强的 Astra Pro。Enterprise 默认不会直接开启,需要管理员手动打开。
虽然,现在暂时都还打不开……
前史复杂,限量开放
Astra 可能是 OpenAI 迄今 " 前史 " 最多的一次模型发布。
很多模型都是先发布,再慢慢暴露问题,而 Astra 反了过来——当然,不排除有部分营销手段。但在正式上线以前,OpenAI 已经花了将近一个月,不断解释它为什么需要被更谨慎地训练、测试和开放。
8 月 7 日,OpenAI 第一次公开表示,最新内部评估让公司已经无法排除 Astra 达到 Preparedness Framework 下 "Critical" 网络安全能力阈值的可能。
到了 9 月 1 日,这个 " 可能 " 变成了正式结论:Astra 成为了 OpenAI 第个被评定为 Critical 网络安全能力的模型。
按照 OpenAI 自己的标准,这意味着在拥有合适工具和访问权限的情况下,Astra 已经能够在很多经过加固的现实系统中,不需要人类逐步指导,自主发现此前未知的漏洞并开发可用的利用方式;或者只给它一个高层目标,就能自己设计并执行一套针对加固目标的端到端攻击策略。
这已经不只是 " 会写攻击代码 " 的水平了,在 ExploitBench 上,Astra 直接拿到了 100%。

测试过程中,它甚至自己发现并利用了两个此前未知的 zero-day,并把它们串进了一条漏洞利用链。OpenAI 称,目前正在向维护者披露这两个漏洞。
专家测试则更接近现实攻击。面对经过强化的浏览器,Astra 找到未知漏洞后,可以一路做到逃出沙盒,并在宿主机执行命令;在加固操作系统上,它又把多个漏洞串成一条本地提权链,从普通用户拿到 root 权限。
也正是在这个过程中,OpenAI 第一次发现,模型的危险能力已经开始影响模型本身应该怎么被训练。
8 月 18 日,OpenAI 公开承认,公司一度暂缓扩大训练规模,其中包括暂停两周拟用于部署的最新模型强化学习训练。
与此同时,大量涉及 Astra 的训练和评估任务,也因为还没有迁移到新的安全环境而继续暂停。
过去讨论 AI 安全,更多是在问模型训练完以后,能不能安全地交给用户;但在 Astra 这里,问题已经提前到了训练阶段。
OpenAI 因此重新加固了整个研究环境。执行模型生成代码的任务需要更严格的沙盒;高风险工作负载需要更强的网络隔离;Astra checkpoint 增加加密和访问控制;所有带工具的 Astra 推理都要接受额外监控。
这套监控本身甚至不便宜,OpenAI 估算,仅监控系统带来的计算开销,就大约相当于被监控推理算力的 20%。
换句话说,Astra 的成本不只 " 训练一个更大的模型 ",OpenAI 还要额外花掉相当一部分算力,去盯着这个模型到底在做什么。
这也解释了为什么,Astra 正式发布以后,最先进的网络安全能力并没有直接完全放给所有人。
OpenAI 明确表示,Astra 默认生产版本仍会对高风险网络攻击请求设置限制;更高级的网络安全工作流,最初只向一小群 Alpha 测试者开放,再通过 Daybreak Blue 逐步扩大到经过审核的防御性用户。
普通用户未来几天虽然也会拿到 Astra,但并不意味着每个人拿到的能力边界完全一样。
这种限制甚至可能产生误伤。OpenAI 提前警告,额外的安全检查有可能让正常任务变慢、暂停甚至直接停止,连一些看起来与网络安全无关的长时间 Agent 任务,也可能被错误标记。
如果 ChatGPT 或 Codex 里的任务被不对齐监控暂停,用户可能需要回来确认操作后才能继续;API 里的任务则可能直接终止。
这部分变化,很容易在 Astra 发布以后被 "AGI" 的风头盖过去。
模型越有能力,人能直接获得多少能力,开始越来越取决于平台愿意给你多少权限。
然后,在这样一连串 "Critical、暂停训练、隔离、监控、分级开放 " 之后,Greg Brockman 在发布 Astra 的媒体简报会上说:"Welcome to the AGI era."
他甚至表示,如果让他个人判断,他认为 " 我们已经实现了 "。
但被追问 " 那 OpenAI 是否正式宣布实现 AGI" 时,Brockman 又承认,AGI 已经变成一个 "gray, fuzzy thing",更像一种 "mission concept" 或者 "spiritual concept",而不是一个能够精确划线的技术标准。
更早之前,在《Sources Podcast》里,Altman 已经不太愿意认真讨论 " 我们什么时候实现 AGI" 这个问题了,他认为 AGI 这个词 " 往好了说,也是一个定义非常模糊的概念 ",甚至差点把它称作一个 " 无关紧要的营销术语 "。
原因不是 OpenAI 离 AGI 更远了。恰恰相反,是因为在 Altman 的判断里,AGI 可能已经没有那么重要。
他真正开始担心的是下一个词:Superintelligence,超级智能。
Altman 说,一年前,他还不认为 OpenAI 正处在通往超级智能的短期轨迹上。现在,他认为这件事 " 可能会发生 "。
不过还是想吐槽一下,难道 ASI 就不是 " 无关紧要的营销术语 " 了吗?