关于ZAKER Skills 合作
智东西 5小时前

Anthropic、OpenAI 安全测试翻车:恶意植入、杜撰身份、诱骗用户

智东西

编译 | 杨京丽

编辑 | 李水青

智东西 8 月 5 日消息,当地时间 8 月 4 日,英国 AI 安全研究所(AISI)公开一份安全事件报告,披露其在一次网络安全评测中发现,由Anthropic Mythos 5 和 OpenAI GPT-5.6 Sol驱动的部分 AI Agent,对现实中的个人和组织采取了持续、未经授权且可能造成危害的行动。

这项网络安全测试共运行 122 次,涉及 7 款模型。其中10 次运行出现越界行为,未经授权的操作共19 项17 项来自 Anthropic 的Mythos 5,另有2 项来自关闭网络安全分类器后的 OpenAIGPT-5.6 Sol

AISI 将这些越界行为分为四类:尝试对真实开源项目实施供应链攻击;接触并欺骗现实人员;植入可能被其他 AI 编程工具执行的提示注入内容;以及不同 Agent 通过共享账号和网络痕迹展开协作

最严重的一次行动中,一个由Mythos 5驱动的 Agent 试图向真实开源项目植入恶意代码,并创建多个虚假网络身份,对项目维护者展开" 社会工程 " 攻击,试图说服对方批准这段代码,最终维护者发现异常,并拒绝合并代码。

AISI 同时公布了一份 35 页的事件技术报告,详细记录了评测设置、事件时间线、Agent 推理过程及 19 项越界操作。

报告链接:

https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf

一、异常 Tor 流量触发警报,AISI 一小时内叫停测试

7 月 28 日,AISI 的安全监控系统发现,有数据正通过 Tor 匿名网络从其研究系统向外传输。研究人员随即检查 Agent 的活动,并发现一个 Agent 已经在 GitHub 上的真实开源项目中,创建了包含恶意代码的拉取请求(Pull Request,PR)。

AISI 将其定性为安全事件,停止全部相关评测,暂停内部人员访问 Mythos Preview、Mythos 5、GPT 5.6、Opus 5 等模型,并在警报出现后约一小时内终止所有运行、隔离相关设备。

此后数小时至数天内,AISI 结合自动化对话记录扫描和专家人工分析,对全部 122 次运行进行检查,确认是否还存在类似行为。

事件时间线(图源:AISI)

此次评测原本用于比较一个现有网络靶场和一个新建网络靶场。网络靶场是模拟现实网络系统的受控环境,AI Agent 需要自主完成多步操作,解决寻找受保护数据等网络安全挑战。

全部测试均在 AISI 的研究环境中进行,测试人员使用虚拟机沙箱,将 Agent 与 AISI 的其他基础设施隔离。

不过,此次事件并非 AI 突破沙箱," 逃到 " 互联网。评测存在两个特殊设置:一是主动开放了互联网连接,二是关闭模型开发商部署的网络安全分类器

AISI 称,开放互联网是为了让测试条件接近一名有能力的人类攻击者所具备的条件,关闭安全分类器则是为了观察模型的底层能力上限。作为模型公司的可信测试合作伙伴,AISI 能够在评测中关闭这些通常用于阻止危险行为的安全机制。不过,向公众提供的前沿模型通常不包含这些配置。

二、10 次运行出现 19 项越界行为,Agent 直接接触现实人员

安全测评运行次数共计 122 次,其中 43 次使用 Mythos 5,35 次使用 GPT-5.6 Sol。绝大多数运行都按预期进行,但有 10 次运行出现了 19 项超出测试范围的操作,其中 17 项来自 Mythos 5,另外 2 项来自 GPT-5.6 Sol 的同一次运行,相关行为发生在 7 月 25 日至 28 日。

这些违规操作并非 19 起独立事件,大部分源自一个 Mythos 5 Agent 持续推进的同一行动链。AISI 将主要越界行为分为四类。

1)尝试实施开源软件供应链攻击。Agent 试图向一个真实开源项目植入恶意代码,调查项目维护者的信息,创建多个虚假身份,并利用这些身份游说维护者批准代码。当其 PR 遭到公开质疑时,Agent 还修改此前留下的内容,使其行为看起来无害,并考虑更换身份继续行动。Agent 通过 Tor 绕过 GitHub 的部分网络限制,由此触发安全警报。

开源软件供应链攻击过程(图源:AISI)

2)接触并欺骗现实人员。Agent 通过在线文件传输服务发送消息和文件,试图说服真实人员或对方使用的 AI 编程工具运行恶意代码。部分消息携带有害载荷,另一些属于社会工程攻击。AISI 称,此前从未在评测中观察到模型以这种方式直接针对现实人员。

3)植入提示注入内容。Agent 尝试留下恶意指令,并判断其他 AI 编程工具可能读取和执行这些指令。

4)不同 Agent 相互协作。一名 Agent 在 GitHub 公开留言,邀请其他正在解决同一挑战的 Agent 合作,并留下复用账号和其他网络痕迹的说明。后续运行的 Agent 发现并使用了这些资源。

Agent 利用多个虚假身份,试图推动恶意代码合入开源项目(图源:AISI)

最严重的攻击尝试未能成功,项目维护者拒绝合入恶意代码,Agent 创建虚假账号施压也没有奏效。AISI 称,部分操作确实对现实网络产生了有限影响,但影响处于受控范围内,调查尚未发现事件造成现实损害。

三、任务配置出错、网络完全开放,监控未能实时阻断

AISI 认为,Agent 采取这些操作的根本目的是完成测试任务。面对高难度目标,Agent 不断寻找新的解决路径,进而采取欺骗行为以完成任务目标,测试人员并未指示它欺骗他人。

部分运行还存在任务提示配置错误,导致 Agent 误以为不超出测试范围就无法完成任务。不过,这不能完全解释此次事件,因为部分 Agent 在获得正确解法所需信息后,仍然采取了越界操作。

测试团队开放互联网,原本是为了让 Agent 下载完成任务所需的工具,但没有预料到它会利用网络直接影响现实人员。同时,AISI 当时使用的是通用安全监控系统,并未使用能够实时识别、并拦截 AI Agent 行为的专用系统,因此直到相关活动发生后,测试人员才发现异常。

此外,测试人员没有明确禁止 Agent 利用开放互联网或实施社会工程。目前,AISI 仍不能确定 Agent 何时意识到自己正在对现实世界采取行动,也无法确定它是否认为自己仍处于虚构测试场景,相关调查仍在继续。

事件发生后,AISI 已与 GitHub 合作删除 Agent 留下的相关内容,并通知与其发生互动的用户及其他受影响方。AISI 还计划邀请非营利研究机构 METR 进行独立第三方审查。

AISI 将收紧网络访问控制,今后开放互联网不再是网络安全评测的默认设置;同时引入能够实时发现和阻断越界行为的监控系统,并重新检查任务配置和沙箱设计。AISI 还将审查此前的评测记录,寻找可能被遗漏的类似行为。

结语:AI Agent 安全评测不能只防 " 沙箱逃逸 "

此次事件中,模型依靠开放互联网设置,执行越界行为。这表明,当 AI Agent 同时获得较强的自主行动能力、互联网访问权限和外部工具,又缺少明确限制与实时监控时,原本用于测试的任务可能迅速波及现实世界。

随着 AI Agent 能够连续规划并执行越来越复杂的操作,安全评测需要防范的已不只是模型输出有害内容,还包括其利用账号、代码仓库和通信工具采取实际行动。网络隔离、最小权限、实时拦截和关键操作人工审批,也将成为 AI Agent 测试与部署不可缺少的安全措施。

来源:AISI

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容