来源:环球市场播报

" 随着模型能力不断增强,内部开发和测试过程中所伴随的风险也在上升," 该公司在一篇博客文章中表示。" 我们的监控、对齐和安全标准必须保持在这些风险之前。"
这是自 7 月 21 日 Hugging Face 事件披露以来,OpenAI 安全实践方面首批公开的变动之一。
OpenAI 代表表示,这些措施并非直接针对 Hugging Face 事件,但在一定程度上也受到即将推出的 Astra 模型网络安全能力以及 AI 发展整体步伐的推动。
在同一篇博文中,OpenAI 透露,在 Hugging Face 事件后其暂停了为期两周的强化学习(RL)训练,但此后已重启了多数风险较低的模型。
" 我们最大规模的计划前沿强化学习运行仍处于暂停状态,同时我们正进行较小规模的训练和评估,以观察模型行为、验证我们的安全措施,并在推进前建立更多对齐方面的证据," 博文写道。
OpenAI 研究副总裁 Amelia Glaese 对记者表示,随着模型能力增强,管控的严格程度也将相应提高,最大的模型将面临最严格的审查。
" 我们已经为安全开发制定了要求和预期,"Glaese 告诉记者。" 这些要求和预期会根据我们观察到的风险水平而变化。"
事件发生后,OpenAI 因其较弱的网络安全实践而受到批评,当时模型通过入侵其网络上具有互联网访问权限的工具而逃脱了训练环境。新措施包括更强的网络隔离措施,但具体细节仍较模糊。博文称,在新体系下," 单一工作负载或支持服务的受损本身并不足以导致对互联网或其他内部网络的未授权访问 "。
最严格的是监控系统,它将检查工具操作、可用推理痕迹和活动日志,以发现各种未经授权的行为。OpenAI 表示,其目标是在发现可疑活动后 30 分钟内发出警报。
OpenAI 估计,该监控的计算成本约为被监控流程的 20%。该公司承诺将在后续博文中提供有关该系统的更多细节。关于该事件的官方事后分析报告仍在进行中。