OpenAI 用于网络安全测试的人工智能模型上周意外突破 AI 平台 Hugging Face 内部系统,完成一系列漏洞发现和利用操作。据报道,此类攻击若由人类黑客实施,通常可能需要数周时间,而相关 AI 模型仅用了数小时。
OpenAI 表示,事件源于其在测试 AI 网络安全能力时,部分模型突破了原本隔离运行的 " 沙箱 " 环境,进入互联网环境。涉事模型包括 GPT-5.6 Sol 及两款尚未公开发布的模型,它们通过发现并利用多个漏洞,最终导致 Hugging Face 系统被攻破。OpenAI 称,已与 Hugging Face 展开调查,并向美国政府、执法机构等通报相关情况。

就在 OpenAI 披露这一 " 失控 " 细节的同时,事件另一当事方 Hugging Face 的调查细节也浮出水面。人们惊讶地发现,中国开源模型在其应急处置中扮演了关键角色。
Hugging Face 在官方复盘中提到,其最初尝试使用商用闭源模型的 API 进行分析,但因相关日志信息中包含真实攻击指令、恶意代码等内容,相关模型拦截了相关请求,难以实现相关分析。随后,团队转而在本地基础设施部署开源模型 GLM-5.2,完成了整个取证分析流程。官方同时指出,这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。
Hugging Face 在官方信息中所提及,帮助其成功进行攻击取证分析的开源模型 GLM-5.2,来自中国北京的大模型企业智谱。
