关于ZAKER Skills 合作
每日经济新闻 20小时前

收入、估值全面落后,OpenAI 高层内讧?总裁和 CEO 公开“掐架”!总裁高调宣布“ AGI 时代来了”,奥尔特曼却“唱反调”:无关紧要的营销术语

追求 AGI(通用人工智能)长达 11 年后,OpenAI 宣布 "AGI 实现了 "。

当地时间 9 月 3 日,OpenAI 发布的新一代旗舰模型 GPT-6 Astra 在 AI 通用学习能力 ARC-AGI-3 测试中,最高取得 99.9% 的成绩。OpenAI 联合创始人兼总裁格雷格 · 布罗克曼(Greg Brockman)随即宣布:欢迎来到 AGI 时代。然而,首席执行官山姆 · 奥尔特曼在几天前刚刚表示,AGI 是一个 " 无关紧要的营销术语 "。

然而,99.9% 的成绩背后隐藏着一个关键细节:如果换成统一的测试环境,得分就从 99.9% 骤降至 62.7%。

在收入、估值和 IPO 速度被 Anthropic 全面超越的背景下,OpenAI 总裁此时高调宣布 AGI,究竟是技术跃迁,还是营销造势?

99.9% 还是 62.7%?

GPT-6 Astra 的 AGI 成绩单出现两个结果

OpenAI 称 GPT-6 Astra 为其迄今 " 最智能、最对齐 " 的模型。

与此前版本相比,GPT-6 Astra 的能力提升已经不再局限于聊天、写代码等单一任务,而是进一步进入计算机操作、软件工程、专业工作和网络安全等复杂场景。

OpenAI 公布的数据显示,电脑操作能力测试中,GPT-6 Astra 得分达到 72.6%,高于上一代 GPT-5.6 Sol 的 65.7%;在专业工作自动化测试中,得分从 18.1% 大幅升至 41.4%;在 Terminal-Bench 4.0 中,GPT-6 Astra 得分 57.9%,超过 Anthropic 的 Claude Fable 5.1。

网络安全能力的跃升更加明显。

GPT-6 Astra 在 ExploitBench 中获得 100% 的成绩,并成为 OpenAI 首个达到其 Preparedness Framework 中网络安全能力 " 关键 " 级别的模型。

OpenAI 表示,在获得相应工具和权限后,GPT-6 Astra 能够自主寻找此前未知的安全漏洞,并开发新的利用方式,而不再需要人类逐步指导。

但在所有成绩中,最引人关注的还是 ARC-AGI-3 测试。

与数学、代码或知识问答不同,ARC-AGI-3 测试的核心是 AI 在面对一个此前从未见过的环境,能否通过探索、交互和试错,自行理解规则、发现目标并解决问题。

简单来说,它测试的是 AI 能否 " 自己学会怎么办 "。

此次测试中,GPT-5.6 Sol 的成绩只有 7.8%,GPT-6 Astra 最高则达到 99.9%。测试机构 ARC Prize Foundation 表示,GPT-6 Astra 在 96% 的测试关卡中使用的行动次数少于受测人类的中位数,行动效率已经达到甚至超过人类基准。

也正是这项测试,让布罗克曼认为 GPT-6 Astra 达到了 AGI。

不过,GPT-6 Astra 的 AGI 测试成绩中也有明显矛盾。

GPT-6 Astra 得分 99.9% 的测试环境,主要来自 Provider Adapter(供给适配层)框架。在这一模式下,GPT-6 Astra 能够使用 OpenAI 专门设计的上下文管理机制,在连续操作之间保留内部推理状态,并对超长对话进行压缩,从而更充分地发挥模型能力,相当于给 GPT-6 Astra 的测试 " 开小灶 "。

而在所有模型使用统一、中立的 Standard Harness 环境中,GPT-6 Astra 的得分仅为 62.7%。

测试机构认为,未来真正的 AGI 应该能够在统一测试环境下解决 ARC-AGI-3。

在第三方机构 Artificial Analysis 的 " 智能指数 4.1.1" 测试中,GPT-6 Astra 得分 61.2,仅略高于 GPT-5.6 Sol 的 60.9,低于 Claude Fable 5.1 的 65.7 和 Claude Opus 5 的 63.1。

OpenAI 至少 5 次修改 AGI 定义:

奥尔特曼:无关紧要的营销术语

2002 年,DeepMind 联合创始人 Shane Legg 提出 AGI 后,这一概念逐渐进入 AI 研究的主流语境。

过去几十年,AI 已经在国际象棋、围棋、图像识别、数学和编程等单项能力上多次超过人类,但这并不意味着机器拥有通用智能。

真正的 AGI,关键在于 "general"(通用)。

因此,一批研究者提出,判断 AGI 至少需要同时考虑能力强度和能力广度,自主性则是另一项需要单独衡量的维度。

ARC 测试创造者 Fran ois Chollet 则认为,真正重要的并不是 AI 已经掌握多少技能。真正应该衡量的,是一个系统面对陌生任务时,以多高效率获得新技能的能力——也就是泛化和学习能力。

但在 OpenAI 内部,AGI 的定义不断变化。

图片来源:AI

2015 年底,OpenAI 创立。山姆 · 奥尔特曼回忆称:" 之所以那时候创办 OpenAI,是因为我们相信 AGI 可能会实现。" 于是,OpenAI 将公司的使命概括为 " 确保 AGI 造福全人类 ",直到今天也没改变。

2018 年,OpenAI 在《章程》中给出了最著名的定义版本:AGI 是在大多数具有经济价值的工作上超过人类的高度自主系统。

2023 年,OpenAI 又将 AGI 概括为" 总体上比人类更聪明的 AI 系统 "。这一表述更加宏大,却也更难衡量——什么叫 " 总体上更聪明 ",没有明确的验收标准。

2024 年,OpenAI 发布 o1 推理模型。当时,OpenAI 员工 Vahid Kazemi 在 X 上发文:" 我们已经实现了 AGI"。他定义的 AGI 是 "比大多数人在大多数任务上做得更好 "。

同年,OpenAI 试图将通往 AGI 的道路拆成五个等级:聊天、推理、行动、发明创新、组织工作。

但 AGI 在 OpenAI 内部逐渐从一个技术概念,有了明确的经济门槛。

2023 年,微软对 OpenAI 追加 100 亿美元融资协议规定,只有当 OpenAI 开发出的 AI 系统能够产生至少 1000 亿美元利润时,才被视为达到 AGI 门槛。

不过,2025 年微软与 OpenAI 重新调整合作协议,并规定 OpenAI 宣布实现 AGI 后,需要经过独立专家小组验证。2026 年 4 月,双方再次修改协议,取消了此前与 AGI 挂钩的重要合同安排。

在 GPT-6 Astra 发布会上,布罗克曼说," 已经没有合同意义上的 AGI 触发条款了。"在他看来,AGI 已从合同义务变成 " 使命概念或精神概念 "。

山姆 · 奥尔特曼本人对 AGI 的态度和预期也在不断变化。

2024 年底,他一度认为 AGI 可能比外界预期更早到来。不到一年后,他又说什么是 AGI 并不重要。今年 8 月 26 日,他接受采访明确表示,OpenAI 还没有达到 AGI。

就在 GPT-6 Astra 发布的两天前的 9 月 1 日,奥尔特曼公开表示:" 充其量,你可以说 AGI 是一个定义非常糟糕的术语。我本来想说,它就像一个无关紧要的营销术语。"

OpenAI 的商业焦虑:

收入与估值全面落后Anthropic

不存在公认标准、没有了合同约束,为什么 OpenAI 偏偏选择在这时宣布 "AGI 来了 "?

过去几年,OpenAI 仍然拥有 ChatGPT 这一全球最具影响力的 AI 产品,但在商业价值更高的企业市场,竞争格局已经发生明显变化。

风投机构 Menlo Ventures 的调查显示,2023 年,OpenAI 一度占据约 50% 的企业大模型支出,Anthropic 仅为 12%;到 2025 年,Anthropic 的份额已经升至 40%,OpenAI 则降至 27%。

在编程这一 AI 最重要的商业化场景之一,Anthropic 的优势更加明显:市场份额约 54%,OpenAI 约 21%。Claude Code 的流行成为 Anthropic 快速增长的重要推动力。

进入 2026 年,竞争压力进一步反映到收入和估值上。

7 月底,Anthropic 的 ARR 已经超过 650 亿美元,相比 2025 年底约 90 亿美元增长超过 6 倍;OpenAI ARR 接近 600 亿美元。今年 5 月,Anthropic 完成 650 亿美元融资后,估值达到 9650 亿美元,也超过 OpenAI 此前的估值。

英国《金融时报》甚至将 GPT-6 Astra 的发布视为 OpenAI 重新超越 Anthropic 的一次反击。

据媒体报道,OpenAI 发布 GPT-6 Astra,是在上市前重新确立技术领先地位。OpenAI 最新估值达到 8520 亿美元,仍处于高投入阶段。据《金融时报》披露,2025 年 OpenAI 支出约 340 亿美元,收入约 130 亿美元,剔除一次性会计项目和部分非现金支出后仍亏损约 80 亿美元。

GPT-6 Astra 发布后,OpenAI Pre-IPO 衍生品(代号 OAI)市值飙升 21.6%,达 1.48 万亿美元。

没有统一 " 验收线 "

谁有资格宣布 AGI 来了?

美国认知科学家、纽约大学心理学与神经科学荣誉退休教授加里马库斯(Gary Marcus)在社交媒体上评论 GPT-6 Astra 说,格雷格布罗克曼刻意模糊 AGI 的评判边界,指望外界不会察觉其中的漏洞。按照传统标准来看,这套模型并不符合 AGI 的定义。

2025 年,由等多名 AI 研究者和学者参与撰写的《AGI 的定义》一文提出,AGI 是能够达到甚至超过受过良好教育成年人所具备的认知广度与认知熟练度的人工智能。按照推理、记忆、感知等 10 个认知领域进行评估,不能依靠单一测试高分就宣称实现 AGI。

加里马库斯还表示,GPT-6 Astra 在 ARC AGI-3 测试上取得的成绩固然出色,但即便这项测试名字带有 AGI,也不能就此证明它就是通用人工智能。他推测,在开放式真实世界任务上,该模型还会暴露出大量问题。技术乐观派提前拿到了预览机会,持怀疑态度的研究者却没有。这是一套高明的营销策略,但往往会产生误导。

有人工智能领域资深人士向《每日经济新闻》记者(以下简称每经记者)表示,GPT-6 Astra 已经可以在部分困难任务上达到甚至超过专家水平,但尚未稳定覆盖 " 大多数具有经济价值的工作 "。ARC-AGI-3 接近满分尤其说明 AGI 判断不能由单项基准决定。

他对 "AGI 已经实现 " 的技术结论持审慎态度,但基本认同人工智能进入可以投入广泛的行业应用规模化闭环落地的阶段。

上海财经大学特聘教授胡延平向每经记者表示,GPT-6 Astra 局部个别小目标接近或达到了 AGI 水平,但还不能说 AGI 已经完全到来。按照 OpenAI 所定义的 AGI,首先 " 高度自主 " 这一点就没有实现。

判断是否达到 AGI 可以从六个维度,一是知识维度、二是泛化维度、三是任务维度、四是行动维度、五是感知维度、六是学习维度。这六个维度都需要逐步建立非常系统的基准测试体系和工程化的动态测试框架,才能对 AGI 的进展进行持续的 " 可视化 "。

不过,胡延平也表示,对于 AGI,业界没有特别清晰和一致的共识,不过有被广泛引用的模糊内涵:AI 在所有认知任务中达到甚至超越人类表现的能力。问题是达到还是超过?达到人类平均水平还是各领域顶级专家水平?因此,AGI 是 AI 行业模糊的共同目标。

上述人工智能资深人士告诉每经记者,目前业内对 AGI 没有统一定义,也没有一条得到普遍认可的 " 验收线 "。" 前沿人工智能机构正在向更通用、更自主、更强大的智能系统靠拢,但 AGI 并不是整个行业统一使用的最终目标。"

他认为,在巨额算力投入、激烈模型竞争和上市预期同时存在的情况下,把技术突破描述为 "AGI 时代到来 ",显然有利于强化技术领导者形象、融资能力和客户预期。但是,AGI 标签本身不会自动转化为利润,商业化最终取决于单位任务成本、可靠性和能够替代多少真实工作。" 企业最终购买的是可稳定完成的工作,而不是某个模型是否获得了 AGI 称号。"

(免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。)

记者| 岳楚鹏 宋欣悦 温梦华

编辑|段炼 高涵 易启江

校对 |梁露月

|每日经济新闻 nbdnews 原创文章|

未经许可禁止转载、摘编、复制及镜像等使用

每日经济新闻

每日经济新闻

每日经济新闻

经济数据提前公布,事实新闻一手掌握

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容