关于ZAKER Skills 合作
钛媒体 1小时前

AGI 怎样才算真的来了?

文 / 吴绛枫

9 月 3 日,OpenAI 总裁格雷格 · 布罗克曼在发布新模型 GPT-6 Astra 后,抛出了一句话:" 欢迎来到 AGI 时代。"

三天后,黄仁勋在社交平台上把话说得更直接:" 从 ChatGPT 到 o1,再到 GPT-6 Astra,只用了四年。AGI 已经到来。"

众所期待的 AGI,就这么突然被宣布实现了?

显然,事情没这么简单。

GPT-6 Astra 发布前不久,OpenAI CEO 山姆 · 奥尔特曼还在说,AGI 是一个 " 定义极其模糊的词 ",甚至差点称它为 " 无关紧要的营销术语 "。

负责 GPT-6 Astra 关键评测的 ARC Prize 团队也专门提醒:GPT-6 Astra 确实代表了通用化能力的重要进步,但 " 我们并不声称它就是 AGI"。

一边是 " 欢迎来到 AGI 时代 ",一边是 " 我们没有说这是 AGI"。

今天,谁都在谈 AGI,却没有谁能说清楚:AI 究竟要做到什么,才算真正越过了 AGI 这条线。

榜单上的高评分,能和 AGI 划等号?

先来看看 GPT-6 Astra 最令人咋舌的成绩,是在 ARC-AGI-3 上拿到 99.9%。

ARC-AGI 与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。

这项评测试图衡量的,正是当前 AI 最受质疑的一种能力:面对没见过的问题,能不能现场学会。

99.9% 的得分当然惊人。但这个数字有一个常被省略的前提。

在 ARC Prize 统一提供的标准测试框架中,GPT-6 Astra 得分为 62.7%;接入 OpenAI 提供的专用适配框架后,得分才上升到 99.9%。

后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。

我们无法把 OpenAI 这项操作简单归类为 " 作弊 "。毕竟,现实中的 AI 本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。

问题在于,62.7% 测量的更接近单个模型的能力;99.9% 测量的则是一套经过专门优化的完整系统。

两项成绩都是真的,却不能混为一谈。更不能把 99.9% 的测试得分,顺手换算成 "99.9% 的 AGI"。

此外,GPT-6 Astra 在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。

它在高难数学测试 FrontierMath Tier 4 上达到 97.6%,在计算机操作测试 OSWorld 2.0 上得到 72.6%;但到了更接近真实办公流程的 AutomationBench,成绩降至 41.4%,在复杂专业任务测试 Agents ’ Last Exam 上也只有 59.3%。

这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra 已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。

AI 在封闭考试中表现出色,并不新鲜。

深蓝击败国际象棋世界冠军,Watson 赢下《危险边缘》,AlphaGo 走出 " 神之一手 " 时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。

规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。

人人都在说的 AGI,是同一个东西吗?

AGI 至今缺少统一共识。

OpenAI 采用了最具经济导向的定义。其在 2018 年发布的公司章程将 AGI 描述为" 在大多数具有经济价值的工作上超越人类的高度自主系统 "。

这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。

现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。

这一标准与 OpenAI 近年的产品路线高度契合。

推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex 等产品进一步进入软件开发流程。

各项能力最终汇向同一个目标:让 AI 承担更完整的工作,并将模型能力转化为可规模化部署的生产力。

Anthropic 对 AGI 的处理方式更加谨慎。CEO 达里奥 · 阿莫迪认为,这个词承载了过多模糊含义,因此更常使用 " 强大的 AI"。

在 2024 年 10 月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统:

它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。

这幅图景包含能力、自主性和复制规模三个变量。三者共同决定 AI 的现实影响,也会同步放大滥用、失控和系统性风险。

基于这一判断,Anthropic 将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。

Google DeepMind 关注的,则是 AGI 的测量标准。

其 2023 年发布的《Levels of AGI》文章,以 " 性能 " 和 " 通用性 " 为两条主轴,将通用智能划分为 " 新兴 "" 胜任 "" 专家 "" 大师 " 和 " 超人类 " 五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。

2026 年 3 月,DeepMind 进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。

评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。

DeepMind 还与 Kaggle 设立 20 万美元奖金,为其中五个评测较薄弱的维度征集测试方案。

这套思路把 AGI 从单一标签转化为可比较的认知能力图谱,也体现了 DeepMind 的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。

关于 AGI 的定义,不只是一个概念问题。

采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。

定义看似在描述未来,其实也在塑造未来。

为什么说 "AGI 是否到来 ",成了一场叙事之争?

人们总是习惯把技术革命想象成一个明确的瞬间。

莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗 11 号登上月球。

历史需要日期,也偏爱标志性画面。

回到当下的 AGI 到来之争,"GPT-6 Astra 就是 AGI" 与 " 我们进入了 AGI 时代 ",其实是两种不同性质的表达。

前者是可以被质疑和检验的技术结论:既然它是 AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。

后者则更像一种时代判断。布罗克曼说的正是 " 欢迎来到 AGI 时代 "。这种表述既制造了历史时刻,又保留了足够大的解释空间。

对模型公司和 AI 产业链而言,"AGI" 首先是一种强大的产品叙事。

模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。

"AGI 时代来了 " 却可以把一切压缩成一句话。

它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。

对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。

黄仁勋的表态,也不能脱离这个叙事框架来理解。

2025 年 9 月,英伟达与 OpenAI 宣布达成战略合作意向。按照当时公布的计划,OpenAI 将部署至少 10 吉瓦的英伟达系统,规模相当于数百万颗 GPU;英伟达则准备随着基础设施逐步落地,向 OpenAI 投资最高 1000 亿美元。

这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。

但在最初的合作设想中,英伟达被定位为 OpenAI 扩建 AI 基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于 OpenAI" 迈向部署超级智能 " 的路径。

近期,黄仁勋在宣布 "AGI 已经到来 " 的同时,专门提到训练 Astra 所使用的英伟达计算系统,以及下一批即将上线的 GPU。

整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。

作为全球 AI 算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。

事实上,这也不是黄仁勋第一次宣布 AGI 到来。

2024 年,他曾表示,如果把 AGI 定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。

到 2026 年 3 月,他又在 Lex Fridman 的播客中表示:" 我认为我们已经实现了 AGI。"

这么看来,AGI 不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。

至于 AGI 怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告?

也可能,这就是一个所有人都身处其中、潜移默化的过程。

正如知名 AI 研究者、OpenAI 创始成员 Andrej Karpathy 提出的一个判断,AGI 不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容