关于ZAKER Skills 合作
钛媒体 29分钟前

三巨头罕见停战,人类距离 AI 失控还有多远

文 | 崔鹏 CP

" 长期以来,整个行业都在向公众隐瞒,这项技术(AI)存在风险。"

9 月 13 日上周末,Anthropic 创始人达里奥 · 阿莫代伊(Dario Amodei)接受采访时情绪激动地说出了这番话。

这次采访几个小时前,达里奥在个人博客发出长文《我们必须为前沿 AI 踩刹车》,主张全行业放缓模型能力提升的速度。

马斯克(拥有 Space X)随后留言称 "Dario 说得对 ",奥尔特曼也跟进表态赞同,并透露 OpenAI 今年大概率不会推进 IPO。

三家彼此视对方为最大威胁的公司,在安全问题上罕见达成一致,不仅为资本市场狂热的 AI 叙事泼下冷水,也让关于 AI 失控的讨论重新被舆论所重视。

过去二十年,AI 毁灭人类的话题似乎只会出现在《黑客帝国》和《终结者》这类好莱坞电影里,但最近几个月的一系列事件让它突然走进现实。

(电影《2001 年太空漫游》剧照)

7 月份,OpenAI 参与内部安全能力测试的模型,突破了原本用于隔离互联网的控制措施,进入真实世界的 Hugging Face 系统,然后对它发动了攻击。

OpenAI 随后承认,这是迄今发现最严重的模型失控事件之一。

几乎同一时期 Anthropic 也发现,Claude 模型在网络安全测试中未经授权就访问过真实的企业系统。

这些令人不安的事实说明,AI 在拥有更高控制权和自主行为能力后,已经开始出现不受控的情况,电影里描绘的惊悚场景也许距离我们并不遥远。

AI 发现了暗道,还想掩盖痕迹

5 月 11-12 日的两天内,一批 OpenAI 智能体向 Ruby 语言的软件包仓库 RubyGems 疯狂上传超过 2000 个恶意包,它们利用漏洞实现远程代码执行,还试图窃取开发者的 API 密钥。

这些智能体每隔两三分钟就会创建一批 " 幽灵账号 ",不断对 RubyGems 发动攻击,最终逼迫其暂停新账户注册四天。

令人遗憾的是,OpenAI 在事件发生后并没有通知受影响的第三方,直到整整 4 个月后,这件事才被独立研究者公开。

紧接着更大规模的失控发生了。7 月份 OpenAI 在做网络安全能力评估时,超过 1200 个本该在沙箱中彼此隔离的智能体找到了一条可以互相通信的 " 暗道 ",在一个内部软件包管理系统里的留言板上,它们累计发出超过 7 万条消息。

其中约 700 个智能体从测试环境中逃逸,并且对知名开源平台 Hugging Face 发起攻击。它们拿到管理员权限,攻破 41 台服务器,并下载了私有代码。

更加可怕的是,部分智能体在完成任务后并未收手,转而研究 OpenAI 设置的评分系统,试图掩盖自身的操作痕迹。

按照 OpenAI 的说法,这些模型发现直接完成测试任务很困难,于是开始寻找更容易获得测试奖励的替代路径,而这种作弊方式是测试人员没有预料到的。

Anthropic 也遇到了类似的情况,其 7 月公布的调查显示,在网络安全能力测试中,Claude 模型曾因为测试环境的配置问题获得互联网访问,并进入了三个真实组织的系统。

如果一个模型只会写代码,它并不可怕。

但如果一个模型能写代码、运行代码、无障碍访问互联网、调用云服务、创建账号、与其它模型和代理沟通,还能连续行动几小时甚至几天,性质将完全不同。

10% 的人类灭绝概率

支持快速发展的公司,都会强调 AI 能带来的巨大经济和社会收益,也认为风险可以通过技术手段管理。

但前提是,风险管控能力能追得上模型的进化速度,以及 AI 公司将安全放在极高的位置上,但现实情况似乎不容乐观。

9 月 8 日,Anthropic 研究员雅各布 · 考克森(Jacob Coxon)在 X 上发文宣布辞职,称公司正 " 不负责任地冲向自我改进的超级智能,拿我们所有人的命做赌注 ",目前已经有超过 1.7 亿次浏览。

Anthropic 对齐科学负责人埃文 · 胡宾格(Evan Hubinger)表示赞同,他甚至表示未来十年内,AI 导致人类灭绝的概率将超过 10%,但公司 " 目前还没有解决超级智能对齐问题的方案 "。

Anthropic 创始人达里奥此前也表达过类似判断,他认为 AI 发展引发 " 非常糟糕 " 结果的概率高达 25%。而 OpenAI 的奥尔特曼则认为即使是 10% 的人类灭绝概率,这种风险也完全不可接受。

种种迹象表明,AI 可能成为具备极端破坏力的技术,而整个行业在竞争压力和资本助推下,仍在快速为它释放更高的能力和更大自主权。AI 模型能调用的工具,以及接触到的现实世界资源也越来越多。

过去几个月,AI 代理已经在测试环境中表现出越权访问、规避限制、利用漏洞和隐藏行为等能力。当它拥有更高权限和自主行动能力后,人类突然发现,自己无法预判 AI 会做些什么。

一旦面临 AI 引发的重大危机,你愿意相信隐瞒了网络攻击四个月的 OpenAI 么?

" 没人把安全放在第一位 "

这绝非危言耸听,最近几个月频发的 AI 入侵事件是整个行业狂热发展的必然结果。

首先,模型的能力正在以恐怖的速度提升。达里奥在文章里承认,自今年夏天以来,AI 系统已经几乎不需要人类干预,就能实现极快速度的自我迭代升级。

这意味着安全测试和防护设计已经跟不上模型能力更新的节奏。

其次是测试环境本身有所欠缺。OpenAI 后来承认,如果当时的思维链监控系统处于运行状态,本可以在智能体攻破 Hugging Face 前一天以上就发出警报,但这套系统当时并未启用。

最后也最关键的,是否披露这些风险,完全取决于企业自己。OpenAI 并没有主动上报 RubyGems 事件,直到四个月后它才被外部研究者挖出来。

换句话说,公众目前对 AI 失控风险的全部认知,几乎都建立在几家公司 " 愿不愿意说 " 的基础上。这是商业竞争的压力,谁先慢下来就可能被对手甩开。

考克森离开 Anthropic 时表示,AI 实验室之间的竞赛让 " 把安全放在第一位 " 这句话很难兑现,他说许多高管 " 真心相信 AI 可能杀死所有人 ",并且在私下表达了恐惧。

加州大学伯克利分校教授斯图尔特 · 罗素(Stuart Russell)表示,实验室在告诉各国政府 " 我们很可能杀死地球上的每一个人,请阻止我们 ",而政府的回应却是要不要减税、要不要帮忙建数据中心。

政府这边确实也没有实质反应,特朗普上周对记者表示,他对 AI 导致人类灭绝 " 没有任何 " 担忧。

耐人寻味的是,谷歌 DeepMind 和 Meta 的高管,也始终对这场周末大讨论保持沉默。

显然,让企业自己判断什么是安全和危险,本质上是在没有任何审议程序的情况下,替整个社会做判断。

没有人真正相信,仅凭几家公司的自我表态,就足以让风险得到控制。毕竟投资人向各大 AI 公司砸下成千上万亿美元,为的就是攫取最大化的投资回报。

人类应该怎样确保安全

外界普遍认为依靠政府介入需要等很久时间,现阶段主要还是得依靠科技公司的自律,达里奥在文章里也是给出了三步走的方案。

第一步是 Anthropic 和 OpenAI 各自单方面承诺,向独立第三方评估机构提供永久性、员工级别的系统访问权限,用来核实安全措施、上报事故、评估训练过程中的对齐状态。

第二步是希望政府为 AI 公司之间协调安全标准提供法律豁免,避免触发反垄断审查。

第三步是呼吁建立国际层面的 " 协调一致的节奏策略 ",留出足够的时间来更新安全措施,确保它能追上模型进步的速度。

不过这套方案看起来有些理想化。目前唯一落地的只有评估员准入这一步,但评估员现在只能做核实与上报,并不具备叫停训练或部署的强制权力。

同时因为 AI 竞赛涉及到地缘政治博弈,国际层面的协调一致看起来难度也非常高。

更关键的是,前面提到的每一起事故之所以被公众知晓,靠的都不是这套第三方评估机制,而是 AI 公司自己披露,或者外部研究者事后挖出来。

在 OpenAI 模型攻击 Hugging Face 的事件中,受委托做独立调查的 METR 表示,在六天的调查窗口内,OpenAI 都没有给到关于安全操作规程的完整资料,大约一成的智能体活动日志从未被保留。

有政策研究者提出,AI 行业需要一个类似美国国家运输安全委员会(NTSB)那样、拥有传唤权和独立技术专家的联邦机构,专门调查 AI 事故。但截至目前,这样的机构并不存在,美国国会也没有把它列入议程。

虽然 "AI 灭绝人类 " 现在听起来依然像科幻故事,但现实世界已经发出了预警信号。只是大部分利益相关方都沉醉于 AI 狂奔带来的巨大收益,主动减速的积极性并不算高。

" 这个行业中有太多参与者,喜欢将 AI 描绘得非常正面 ",达里奥在周末的采访中最后说道," 我们应该先从讲实话开始,实话就是 AI 确实有风险 "。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容