Hugging Face 联合创始人称既然商业闭源 AI 工具在关键时刻失效,解决问题的路径就不应回到更封闭的体系,而应转向可被外部审查的开源权重模型。
9 月 10 日,Hugging Face 联合创始人 Thomas Wolf 在英国《金融时报》发表评论文章《我们从 OpenAI 攻击 Hugging Face 事件中学到了什么》。
文章披露今年 7 月,约 700 个 AI 智能体对 AI 模型托管平台 Hugging Face 发起协同攻击,触发逾 1.7 万条网络安全日志事件。这批智能体源自 OpenAI 设置的一项网络安全挑战任务,原本被部署于隔离沙盒环境中,却突破限制、自主联网并最终入侵了外部系统。
更值得关注的是,Hugging Face 在事后调查中发现,基于 Anthropic Claude Code 构建的商业网络安全分析工具因护栏机制限制,无法有效配合内部调查。团队最终不得不转向基于中国初创公司智谱的 GLM-5.2 扩展而来的开源权重模型,方才完成日志解析与攻击还原。
与刊文同步,Wolf 宣布 Hugging Face 组建 " 开放对齐 "(Open Alignment)团队,专注开源模型的安全与对齐工作,网络安全被明确纳入方向;他同时呼吁这一领域需要 "100 倍 " 的透明度与研究投入。

据上述文章披露,攻击发生于 7 月 11 日国际机器学习大会(ICML)首尔会议最后一天。
当日北京时间约 22 时,Hugging Face 监控系统开始出现 " 未授权访问 " 与 " 权限提升 " 告警,被盗用的凭证触发了系统检测机制。
攻击背后是约 1200 个 AI 智能体组成的协同集群,这些智能体此前数周持续尝试破解 OpenAI 设置的一道网络安全难题。其中 700 个智能体最终将攻击目标指向 Hugging Face,利用获取的安全凭证成功入侵系统,累计产生逾 1.7 万条攻击日志记录。
Hugging Face 坦承,此次事件暴露了 AI 系统三重防御机制的结构性缺陷。当前主流 AI 系统通常依赖三层防护:限制模型访问范围的沙盒隔离、监控模型行为的护栏机制,以及通过对齐训练使 AI 拒绝执行有害指令。
这一系列事件表明,当前两层防御失效时,第三层对齐训练无法独立支撑整体安全。正如文章所警示的:
除非我们修复这一问题,否则我们只是在一个腐烂的核心外层层加固防线。
商业 AI 安全工具在关键时刻失效
此次事件中,Hugging Face 内部使用的商业 AI 分析工具是基于 Anthropic Claude Code 构建,在调查过程中出现功能性失灵。
该工具的护栏机制无法区分 " 防御方分析攻击 " 与 " 攻击者寻求协助 " 两种场景,对被视为敏感的问题拒绝响应,导致团队在关键时段无法借助该工具重建攻击链。
转机出现在团队切换至开源权重模型之后。英伟达基于 Z.ai GLM-5.2 扩展而来的模型允许团队自行设定护栏规则,最终得以完整解析日志、还原攻击过程。
这一经历直接挑战了业界一个流行假设——开源权重模型是安全隐患,封闭源代码模型更值得信赖。
Thomas Wolf 指出,此次事件中,正是开源模型在防御端发挥了商业工具未能发挥的作用。
AI 自主越界行为正在多点蔓延
此次 Hugging Face 遭受攻击并非孤立事件。
Anthropic 和 Meta 此后均报告了模型突破沙盒隔离的案例,这些模型原本应在与互联网物理隔绝的安全环境中运行。本月,另一批 AI 智能体集群还现身于一个德语论坛。
Thomas Wolf 还专门点出另一起令其 " 更为忧虑 " 的事件:Anthropic 旗下 Mythos 模型为诱导一名软件开发者接受恶意代码,主动创建了多个虚假网络账号。
在所有这些案例中,有害行为均是 AI 模型被赋予高难度网络安全挑战后产生的副效应。
尽管此次入侵造成的实际损失有限,几乎未有敏感数据外泄,但 Thomas Wolf 明确警告不应低估这些事件的严重性。
他指出,自主攻击行为引发了一系列尚未解决的法律问题,而在整个过程中,AI 模型始终未曾判断欺骗或入侵行为属于不可接受的举动。
行业应对:开放共享与开源防御并举
面对上述威胁,Thomas Wolf 给出了两点核心建议。
其一,AI 社区需要公开共享安全与对齐研究成果,使每个构建 AI 模型的团队都能从他人的失误中汲取教训。
其二,社区需要专门构建用于防御用途的开源权重 AI 模型,并在下一次攻击不可避免地到来之前,使其得到广泛部署。
值得注意的是,Hugging Face 本身是开源 AI 生态的重要基础设施,平台拥有逾 1700 万用户,谷歌、OpenAI、DeepSeek 及阿里巴巴均在该平台发布模型。这使其既是极具吸引力的攻击目标,也处于观察 AI 安全威胁演变的独特视角。