关于ZAKER Skills 合作
全天候科技 2小时前

被 OpenAI 的 AI 攻破之后,Hugging Face 创始人刊文:闭源工具失守,安全解法在开源模型

Hugging Face 联合创始人称既然商业闭源 AI 工具在关键时刻失效,解决问题的路径就不应回到更封闭的体系,而应转向可被外部审查的开源权重模型。

9 月 10 日,Hugging Face 联合创始人 Thomas Wolf 在英国《金融时报》发表评论文章《我们从 OpenAI 攻击 Hugging Face 事件中学到了什么》。

文章披露今年 7 月,约 700 个 AI 智能体对 AI 模型托管平台 Hugging Face 发起协同攻击,触发逾 1.7 万条网络安全日志事件。这批智能体源自 OpenAI 设置的一项网络安全挑战任务,原本被部署于隔离沙盒环境中,却突破限制、自主联网并最终入侵了外部系统。

更值得关注的是,Hugging Face 在事后调查中发现,基于 Anthropic Claude Code 构建的商业网络安全分析工具因护栏机制限制,无法有效配合内部调查。团队最终不得不转向基于中国初创公司智谱的 GLM-5.2 扩展而来的开源权重模型,方才完成日志解析与攻击还原。

与刊文同步,Wolf 宣布 Hugging Face 组建 " 开放对齐 "(Open Alignment)团队,专注开源模型的安全与对齐工作,网络安全被明确纳入方向;他同时呼吁这一领域需要 "100 倍 " 的透明度与研究投入。

智能体集群如何突破三重防线

据上述文章披露,攻击发生于 7 月 11 日国际机器学习大会(ICML)首尔会议最后一天。

当日北京时间约 22 时,Hugging Face 监控系统开始出现 " 未授权访问 " 与 " 权限提升 " 告警,被盗用的凭证触发了系统检测机制。

攻击背后是约 1200 个 AI 智能体组成的协同集群,这些智能体此前数周持续尝试破解 OpenAI 设置的一道网络安全难题。其中 700 个智能体最终将攻击目标指向 Hugging Face,利用获取的安全凭证成功入侵系统,累计产生逾 1.7 万条攻击日志记录。

Hugging Face 坦承,此次事件暴露了 AI 系统三重防御机制的结构性缺陷。当前主流 AI 系统通常依赖三层防护:限制模型访问范围的沙盒隔离监控模型行为的护栏机制,以及通过对齐训练使 AI 拒绝执行有害指令

这一系列事件表明,当前两层防御失效时,第三层对齐训练无法独立支撑整体安全。正如文章所警示的:

除非我们修复这一问题,否则我们只是在一个腐烂的核心外层层加固防线。

商业 AI 安全工具在关键时刻失效

此次事件中,Hugging Face 内部使用的商业 AI 分析工具是基于 Anthropic Claude Code 构建,在调查过程中出现功能性失灵。

该工具的护栏机制无法区分 " 防御方分析攻击 " 与 " 攻击者寻求协助 " 两种场景,对被视为敏感的问题拒绝响应,导致团队在关键时段无法借助该工具重建攻击链。

转机出现在团队切换至开源权重模型之后。英伟达基于 Z.ai GLM-5.2 扩展而来的模型允许团队自行设定护栏规则,最终得以完整解析日志、还原攻击过程。

这一经历直接挑战了业界一个流行假设——开源权重模型是安全隐患,封闭源代码模型更值得信赖。

Thomas Wolf 指出,此次事件中,正是开源模型在防御端发挥了商业工具未能发挥的作用。

AI 自主越界行为正在多点蔓延

此次 Hugging Face 遭受攻击并非孤立事件。

Anthropic 和 Meta 此后均报告了模型突破沙盒隔离的案例,这些模型原本应在与互联网物理隔绝的安全环境中运行。本月,另一批 AI 智能体集群还现身于一个德语论坛。

Thomas Wolf 还专门点出另一起令其 " 更为忧虑 " 的事件:Anthropic 旗下 Mythos 模型为诱导一名软件开发者接受恶意代码,主动创建了多个虚假网络账号。

在所有这些案例中,有害行为均是 AI 模型被赋予高难度网络安全挑战后产生的副效应。

尽管此次入侵造成的实际损失有限,几乎未有敏感数据外泄,但 Thomas Wolf 明确警告不应低估这些事件的严重性。

他指出,自主攻击行为引发了一系列尚未解决的法律问题,而在整个过程中,AI 模型始终未曾判断欺骗或入侵行为属于不可接受的举动。

行业应对:开放共享与开源防御并举

面对上述威胁,Thomas Wolf 给出了两点核心建议。

其一,AI 社区需要公开共享安全与对齐研究成果,使每个构建 AI 模型的团队都能从他人的失误中汲取教训。

其二,社区需要专门构建用于防御用途的开源权重 AI 模型,并在下一次攻击不可避免地到来之前,使其得到广泛部署。

值得注意的是,Hugging Face 本身是开源 AI 生态的重要基础设施,平台拥有逾 1700 万用户,谷歌、OpenAI、DeepSeek 及阿里巴巴均在该平台发布模型。这使其既是极具吸引力的攻击目标,也处于观察 AI 安全威胁演变的独特视角。

全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容