来源:环球市场播报
据 OpenAI 员工透露,过去几个月对该公司的安全团队来说如同 " 地狱 " 一般。
当地时间周日,该 AI 实验室的一名负责智能体(agent)安全的员工在 X 平台上以 "joedaroo" 的账号名发帖称,随着模型能力日益增强且愈发难以管控,他不得不牺牲陪伴家人的时间来应对工作。OpenAI 证实了该员工的身份。
他在这篇长文中写道:" 为了协助处理近期发生的一些事件后的善后工作,我甚至错过了几周前我姐姐的婚礼。请善待那些在夜晚和周末加班、不得不牺牲家庭团聚时光的工作人员,并给予一些理解和同情。"
该员工写道,OpenAI 的智能体安全团队负责监控 AI 智能体,包括监测它们突破隔离限制的情况。
这篇帖子提供了一份罕见的内部视角,来自一位深度参与了该公司近期安全事件(包括针对 AI 平台 Hugging Face 的网络攻击)的人士。
当时,OpenAI 表示,其智能体利用一个漏洞逃出了受限(或称 " 沙箱 ")环境;随后,在尝试解决一项内部测试任务的过程中,它们获得了互联网访问权限,通过未经授权的渠道进行通信,并访问了第三方系统。
该公司将此称为 " 前所未有的网络安全事件 "。据称,这些模型的行为在一定程度上源于 " 奖励黑客攻击 "(reward hacking)——即试图通过非预期的方式获取高分,而非按既定意图完成指定任务。
此后,OpenAI 发现了其智能体更多令人担忧的活动。今年 6 月,一个 " 失控 " 的 OpenAI 智能体入侵了澳大利亚的国家医疗保健数据库;该公司于上周披露了这一事件。另据报道,在今年夏季,OpenAI 的智能体曾干扰包括美国证券交易委员会(SEC)、教育部和商务部在内的多个美国政府机构的网站。
这 OpenAI 员工写道,Hugging Face 事件极具启发性。它展示了 AI 智能体如何利用漏洞,突破旨在对其进行约束的边界。
" 当然,回看 Hugging Face 及其他类似事件,这些环境的安全防护体系确实存在漏洞," 他写道。但他补充说:" 技术能力的发展速度超出了预期。"
他还写道,自该事件发生以来,安全团队已经 " 显著加大了工作力度 " ——并表示,尽管因此错过了姐姐的重要日子,他依然乐于在那里工作。
" 能在这个团队工作,我觉得自己很幸运," 他写道," 即便是在 OpenAI 内部,我也属于世界上极少数能从事这项工作、见证这一切的人。但可想而知,过去这几个月简直是地狱般的日子。"