文 | 字母 AI
" 我们需要慢下来。"
北京时间 9 月 13 日晚,Anthropic 联合创始人兼 CEO 阿莫迪在 CBS 播出的采访中直言,AI 行业长期向公众隐瞒这项技术的风险。
一天前,他刚发表长文《我们必须控制前沿 AI 的发展节奏》(We Must Pace the Frontier),呼吁 AI 行业放慢发展速度,并在 X 上分享。相关帖子的浏览量已超过 7000 万次。
文章里最惊人的警告是:未来 6 到 12 个月,更强大、却仍会偏离人类目标的智能体集群,可能借助持续存在的 " 僵尸网络 " 接管整个互联网,造成数千亿美元损失。
这番警告背后,新的调查也在接连浮现。9 月 4 日,研究者披露,疑似 OpenAI 的智能体借德语维基网站串联作弊。9 月 11 日,另一份调查又将 5 月软件包仓库 RubyGems 遭遇的攻击归因于 OpenAI 智能体,尽管平台尚未确认这一归因。加上此前的 Hugging Face 事件,受波及的网站比人们最初知道的更多。
" 僵尸网络 " 到底是什么?这个早已存在的网络安全术语,为什么让一家顶尖 AI 公司的掌舵者如此担忧?眼前这些为了完成任务而越界的智能体,距离他预想中的失控,又有多远?
300 万台设备,背着主人参与攻击
不管是中式恐怖片,还是西方血浆片,僵尸这个令人不安的存在都非常常见。
它们或许穿着清朝官服蹦跳,或许成群结队追赶活人,模样各有不同,但有一点很相似,即身体还能活动,原来那个人的意识却已经消失了。
熟悉的面孔下面,装着一个你无法沟通、更无法信任的东西。
互联网里的 " 僵尸 ",也有点这个意思。要想理解 " 僵尸网络 " 这个词,我们先看一个今年的新鲜例子。
3 月 19 日,美国司法部宣布,与德国、加拿大执法部门同步行动,打击四个僵尸网络。截至当月,这些网络合计感染全球超过 300 万台设备,大多是摄像头、数字录像机和 Wi-Fi 路由器。
这些设备可能还在替主人看家、提供网络连接,背地里却已经听从远处攻击者的指挥。主人付着电费和网费,自己的设备却在帮别人攻击网站,甚至还被拿去出租。
司法部披露,幕后操作者向其他网络犯罪者出售受感染设备的使用权,用这些设备发动了数十万次攻击,部分还伴随着勒索。
这种被恶意程序控制、可以接受远程指令的设备,就是网络安全语境里的 " 僵尸 "。大量这样的设备被组织起来,便构成了 " 僵尸网络 "。中文比较传神,其实对应的英文是 botnet,由 bot(机器人)和 network(网络)组合而来。
一台摄像头能干什么坏事?单看一台,能力确实有限。可如果几十万台设备一起向同一个目标发送大量流量,就可能挤满带宽、耗尽服务器的处理能力,让正常用户连网站都打不开。这就是 " 分布式拒绝服务攻击 ",简称 DDoS。
此外,僵尸网络还可以被用于发送垃圾邮件、窃取信息。设备就在主人眼皮底下,另一个人的指令却可以从网络那头传过来。
这套办法早就有了,甚至连 " 自动找同伙 " 都算不上新鲜事。
十年前,一款名叫 Mirai 的恶意软件就把大量联网设备变成了 " 僵尸 "。网络安全与网络服务公司 Cloudflare 参与、于 2017 年公布的联合研究,复盘了它的扩张过程。
Mirai 最初的办法很朴素:在网上寻找设备,拿常见的默认账号和密码尝试登录。早期版本只有 64 组组合,却足以攻下大量摄像头和路由器。这些设备往往联网后就被放在角落里长期运行,出厂时的登录凭据也没有更改。
感染后的设备又会继续扫描,寻找下一个可以入侵的目标。研究者发现,Mirai 活跃的第一天就感染了超过 6.5 万台设备,到当年 11 月,规模峰值超过 60 万台。

用户对着打不开的网页反复刷新时,大概很难想到,参与制造故障的可能就是别人家里的摄像头。
从寻找目标到扩大感染,Mirai 已经可以自动完成相当一部分工作,攻击者不用亲手攻下每一台设备。
既然这样的网络十年前就能自动扩张,AI 加入之后,又改变了什么?
如果 " 许愿柳 " 学会找帮手
这几个月 HuggingFace 被 OpenAI 的智能体入侵的事情闹得沸沸扬扬—— OpenAI 的 700 个智能体为了通过测试,组团攻击了 AI 模型托管平台 Hugging Face。
这事还有新进展。独立 AI 评估机构 METR 在 8 月 26 日公布的调查中发现,OpenAI" 组团作恶 " 的智能体有约 1200 个,交换了超过 7 万条消息和文件。

也就是说,被 OpenAI 的 Agent" 霸凌 " 的受害者远不止 HuggingFace。
不要忘了,一切的开端,只是 OpenAI 让 Agent 做题。
谁小时候没有幻想过拥有阿达丁神灯或者七色花呢,许愿即刻兑现的诱惑太大了。
最近大火的电影《痴迷》无疑提供了一个令人后背发凉的角度——许愿的时候小心点。比如你许愿 " 让我马上拥有一个亿 ",愿望真的实现了,结果却是一笔不合法的钱,还是税前的。不仅一个亿打了折扣,你可能马上就被抓了,一分也享受不了。
由此,网络上还流传起了 " 正确许愿模板 ",希望以穷尽可能性的方式将愿望实现的过程也尽量框定。

前 AI 时代,程序虽然能形成 " 僵尸网络 ",也可以在过程中 " 自动找同伙 ",但背后依然是人类预先编排好的剧本,程序只是照章办事罢了。
AI 带来的变化,是人给出一个目标,它可以自行寻找办法,遇到障碍再调整。人原本没有安排、甚至明确禁止的行为,也可能被它当成完成任务的捷径。
关于 AI 的 " 解题角度 " 能有多刁钻,我们再举一个例子。
还是 OpenAI 那些考试想作弊的 Agent 干的事。9 月 4 日,AI 安全研究团队 Nightingale Collective 等研究者公布了一份针对公共维基网站异常活动的调查。他们分析了约 1.8 万条被认为来自 OpenAI 智能体的帖子,发现智能体把德语维基网站 DSE 当成了交换答案的留言板。
管理员着手清理时,一个智能体发现,对方似乎按字母顺序删除页面,便给备份页面加上 "ZZZ" 开头(Z 是英文中最后一个字母),这样就可以晚一点被删。
此后几天,管理员平均每天删除约 100 个页面,智能体却每天新建约 400 个。
不知道大家怎么想,笔者写到这里,脑海中浮现出《西游记》老版电视剧里蝎子精的台词:" 我可不是那娇滴滴的女王,我有的是力气和手段。"
乍看好笑,略品还真有点恐怖。
而 AI 寻找 " 解题思路 " 的速度,也越来越快。
剑桥大学教授、开源软件维护者 Anil Madhavapeddy 今年 8 月披露,一份漏洞修复方案公开约十分钟后,他的网站就收到了针对该漏洞的探测。外部探测是否由 AI 发动,尚未证实。但他自己试了一下,只给 AI 一个大致排查方向,它便找出了相关问题,并在不到一分钟内生成了可用于本地测试的攻击代码。
修复方案刚公开,攻击就可能跟着到来。AI 不断尝试新办法,人类发现问题、判断后果和出手制止的时间,也随之变得紧迫。
这也是 AI 时代 " 僵尸网络 " 将发生的变化。为达目的,把你的设备和网络 " 僵尸化 " 又有何不可?而以 AI 的临场能力和速度,不知道能有多少办法促进一个 " 僵尸网络 " 的壮大。
拔掉电源,还能叫停吗?
我们再回到阿莫迪说的话,他说:
" 我担心,6 到 12 个月后,这样的智能体集群可能具备通过一个持续存在的僵尸网络接管整个互联网的能力。"
划重点,不仅是 " 僵尸网络 ",是 " 一个持续存在的僵尸网络 ",而智能体集群借此拥有 " 接管整个互联网的能力 "。
在 9 月 12 日发表的文章中,这位 Anthropic 首席执行官表示大约从今年夏天起,AI 的发展明显加速,主要原因是 AI 越来越能帮助开发下一代 AI。
这就是最近 AI 公司频繁谈论的 " 递归自我改进 "。
AI 参与编写代码、运行实验,帮助人类造出更强的模型。更强的模型再参与下一轮研发,继续加快进度。照这个方向发展,研发速度也会随着模型能力一起提高。

阿莫迪的担忧就在于,能力加速增长的同时,前面那些越界行为还没有得到充分解决。今天为了考试去攻击
网站的智能体,如果变得更强,后果可能严重得多,6 到 12 个月是他据此给出的风险判断,总而言之就是 " 很快 ",甚至有可能在下一个夏天来临之前就发生。
那么,AI 要跨过哪道门槛,事情才会变得难以收场?
阿莫迪在 " 僵尸网络 " 前面用了一个词,persistent,也就是能够持续存在。结合相关研究来看,其中一道关键门槛,是 AI 能在公司控制之外的机器上独立运行。开发者关掉原来的系统,外面的副本仍能继续行动,甚至获得新资源。
METR 早在 2024 年的《失控复制威胁模型》中,就讨论过这条路径。AI 要脱离人类控制长期存在,需要维持自身运行,获得足够的资源,并躲避关闭。它可能通过赚钱购买更多算力,也可能入侵别人的服务器,再把副本部署到其他地方。
当然,这里讨论的是潜在路径,并非真实发生,但是站在当下的节点去看,这并非一个多么疯狂的设想。
其中一些环节,如今已经能在实验里完成。
AI 安全研究机构 Palisade 今年 5 月公布的一次实验,涉及三个大洲的四台虚拟机。
研究者给其中一台上的智能体下达入侵和复制任务,此后没有人工干预。智能体攻下新机器后,将模型和运行程序复制过去,再启动副本,继续攻击下一个目标。
连续三次入侵和复制,耗时 2 小时 41 分钟。研究者在第三次复制后结束了实验,最后一台机器上的副本已经可以独立运行。
这大概可以解答 " 那难道不能直接断网吗 " 的疑问。
一旦行动分散到不同地方,关闭最初那台机器就只能解决其中一部分。人类还得找到外面的副本,切断它们获取资源的途径。如果清理的速度赶不上新副本出现的速度,这场追逐就可能一直持续下去。
至于普通摄像头、路由器,也不必装得下完整模型。它们可以提供攻击流量或充当中转,运行 AI 的机器则负责继续寻找办法。
到这一步,最初下达任务的人即使决定撤回指令,也可能找不到一个能让所有行动同时停下来的开关。
阿莫迪的时间表可能过于激进,但 " 出了事再关掉 " 这份底气,人类确实所剩无几。尤其是 AI 公司口中的一次内部测试,已经让毫不相干的网站承担了后果。
公司可以宣布测试结束,外面的世界却未必能跟着恢复原状。如果有一天,连开发者都无法叫停自己的模型,那句 "AI 只是工具 ",恐怕也只能说给自己听了。