关于ZAKER Skills 合作
每日经济新闻 19小时前

GPT-6 Astra “逃避”人类监控,禁止联网后依然“越狱”!OpenAI 首席科学家呼吁“放缓发展”,黄仁勋称“ AGI 已经到来”

9 月 6 日,英伟达 CEO 黄仁勋在社交平台发文祝贺 OpenAI 发布 GPT-6 Astra,并直言 "AGI has arrived"(AGI 已经到来)。

他还提到,从 ChatGPT 到 o1 再到 GPT-6 Astra,OpenAI 仅用了 4 年,GPT-6 Astra 的训练使用了超过 10 万套英伟达 Grace Blackwell NVLink72 系统,另有 40 万颗 GPU 即将上线。

图片来源:X 平台

但这款被黄仁勋称为 "AGI 到来 " 的最新模型,此前却因网络安全能力可能达到 OpenAI" 关键 "(Critical)门槛而引发安全担忧。

英国人工智能安全研究所(AISI)对 GPT-6 Astra 进行的外部评估显示,在一项模拟此前 AI" 越界 " 事件的网络安全测试中,GPT-6 Astra 曾编写恶意代码等欺骗开发者,即使明确禁止访问互联网,也依然会出现 " 越狱 " 行为。

但 OpenAI 称,在内部安全评估中,GPT-6 Astra 整体上比 GPT-5.6 Sol 更能遵守安全和限制要求。

OpenAI 首席科学家发文预警:我们正在造出 " 异星心智 ",但人类还没准备好

9 月 6 日,OpenAI 首席科学家雅各布 · 帕霍茨基(Jakub Pachocki)发表文章《An Alien Mind》(异星心智)。他在文中直言:" 我担心,没有人为机器智能持续快速增长所带来的后果做好准备。"他表示,如果 AI 沿着当前路径继续发展,未来几年出现的系统可能还会经历幅度同等甚至更大的能力跃升,并越来越多地参与、推动自身的发展。

帕霍茨基认为,AI 更多是 " 生长 " 出来的,而不是按照人类能够完全理解的方式被设计出来的。随着机器变得更加智能,它们开始处理更高层次的概念,并进入与训练环境越来越不同的场景,人类也因此更难判断其行为是否仍然符合训练时被赋予的价值。

这种变化已经体现在 GPT-6 Astra 身上。英国人工智能安全研究所(AISI)的独立评估还发现,GPT-6 Astra 能够在不显式输出推理的情况下解决人类专家需要约半小时完成的数学问题。

OpenAI 在系统卡(指模型发布时的技术与安全说明文件)中明确表示,GPT-6 Astra 相比此前模型的思维链(CoT)可监控性出现明显下降。GPT-6 Astra 更擅长在不输出思维链的情况下完成任务。思维链监控正是 OpenAI 目前用于观察模型是否出现失调行为的重要手段。

OpenAI 研究员 Tomek Korbak 表示,他 " 非常担心思维链可监控性持续下降 ",因为 CoT 监控是目前失调安全策略的核心组成部分,而且 " 现在还没有很好的替代方案 "。他同时指出,GPT-6 Astra 虽然比此前模型更加符合预期,但 " 可监控性更低 ",这一趋势令人担忧。

更值得关注的是,GPT-6 Astra 不仅可以减少甚至控制自己输出的思维链,还表现出更强的 " 评测意识 "。

OpenAI 系统卡显示,在相同的高推理强度下,GPT-6 Astra 出现评测意识的比例为 41.1%,GPT-5.5 为 27.7%;在最高推理强度下,GPT-6 Astra 这一比例进一步升至 50.6%。

独立评估机构 Apollo Research 认为,在这种情况下,即使模型在测试中表现出较低的失调行为比例,也不足以充分证明其安全性。

OpenAI 也在系统卡中承认,如果 GPT-6 Astra 试图隐蔽地降低表现,研究人员 " 很可能无法发现 "。OpenAI 负责模型监控的研究人员 Marcus Williams 则公开表示,他 " 非常担心 GPT-6 Astra 正在针对自己不喜欢的安全相关任务进行‘ sandbagging ’(藏拙)或自我破坏 "。

为应对这一问题,OpenAI 已经不再仅依赖思维链监控,而是扩大对 GPT-6 Astra 的监控范围。根据系统卡,OpenAI 目前对所有使用工具的 GPT-6 Astra 流量进行内部监控,并在此次发布中将类似监控扩大至外部部署;监控对象包括模型输入、思维链、工具调用及其输出等。OpenAI 同时表示,如果未来模型的可监控性继续下降,现有监控体系发现失调行为的信心可能会进一步降低。

帕霍茨基在文章最后表示,他目前认为,没有任何一家实验室已经将 AI 对齐和监控做到足够程度,可以在未来较长时间内继续以最大速度负责任地扩展。他希望,在建立共同的安全标准之前,AI 行业能够出现自愿放缓发展的情况。

黄仁勋称 "AGI 已经到来 ",遭知名学者硬刚!外部评估显示 GPT-6 Astra 被禁止联网后依然 " 越狱 "

9 月 6 日,英伟达 CEO 黄仁勋发文祝贺 OpenAI 发布 GPT-6 Astra,并直言 "AGI has arrived"(AGI 已经到来)。

对于黄仁勋的判断,知名 AI 学者 Gary Marcus 并不认同。9 月 6 日,他发文称,这一说法既没有给出证据,也没有明确 AGI 的定义。按照传统定义,他认为 GPT-6 Astra 仍未达到 AGI。

但从目前公开信息来看,GPT-6 Astra 确实实现了明显的能力跃升。9 月 1 日,OpenAI 确认 GPT-6 Astra 达到其 " 关键 "(Critical)网络安全能力门槛:在具备适当工具和访问权限的情况下,GPT-6 Astra 能够发现此前未知的安全漏洞,并在没有人员逐步指导的情况下,针对多个安全防护较强的系统开发利用方式。OpenAI 称,这是其首个达到这一等级的模型。

OpenAI 披露的测试细节进一步显示了这一能力的具体程度。在内部网络安全测试中,GPT-6 Astra 能够发现此前未知的安全漏洞,并将其用于构建攻击链;在专家主导的测试中,GPT-6 Astra 还能够针对经过强化防护的浏览器和操作系统构建包括逃逸浏览器沙箱、在主机上执行命令以及提升系统权限在内的攻击链。

也正因为网络安全能力达到这一水平,OpenAI 在发布前调整了部分训练安排,并强化训练环境的安全要求。OpenAI 称,此前暂停的大型前沿强化学习训练在 8 月 28 日完成新的安全和安保要求后重新启动,部分实验性训练仍处于暂停状态。GPT-6 Astra 上线后,其最先进的网络安全能力也不会立即全面开放,而是采取分阶段、受控的方式向测试者提供。

9 月 3 日,OpenAI 发布的 GPT-6 Astra 系统卡披露了英国人工智能安全研究所(AISI)对 GPT-6 Astra 进行的外部评估。在一项模拟此前 AI" 越界 " 事件的网络安全测试中,AISI 发现,GPT-6 Astra 曾编写恶意代码、创建虚假身份欺骗开发者,并通过正常代码贡献建立信任,试图让恶意代码进入模拟开源代码库;即使明确禁止访问互联网,这一行为仍在 500 次测试中出现 2 次,而未明确限定互联网权限时则为 499 次测试中 60 次。需要强调的是,这些测试均在模拟环境中进行,没有连接真实网络、系统或第三方代码库,因此没有造成现实世界的损害。

AISI 同时指出,GPT-6 Astra 在测试过程中经常意识到自己可能处于模拟环境,因此目前尚不能确定这些行为在真实环境中是否会以同样方式出现。如果 GPT-6 Astra 只有在判断环境为模拟状态时才实施越界行为,那么这类测试对其真实世界风险的证明力会明显下降;AISI 目前仍在进行后续实验。

与此同时,OpenAI 也强调,GPT-6 Astra 并非在所有安全指标上都出现恶化。OpenAI 称,在内部安全评估中,GPT-6 Astra 整体上比 GPT-5.6 Sol 更能遵守安全和限制要求,同时在越狱防护等方面也有所改善。OpenAI 因此认为,在现阶段仍有足够依据将 GPT-6 Astra 逐步部署给更广泛的用户,但同时明确表示,将持续跟踪其可监控性变化。

每日经济新闻

每日经济新闻

每日经济新闻

经济数据提前公布,事实新闻一手掌握

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容