来源:环球市场播报
OpenAI 于周二表示,其即将推出的人工智能模型 Astra 是首个达到其 " 关键 " 网络安全能力阈值的产品。
该公司称,Astra 能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓 " 准备框架 " 中最先进的类别。OpenAI 表示,仍计划 " 很快 " 提供 Astra,但其网络安全能力的访问权限将更加受限。
OpenAI 于 2023 年推出了其 " 准备框架 ",该框架是公司 " 跟踪并防范可能带来严重危害新风险的先进 AI 能力 " 的方法。在去年对该框架的更新中,公司划分了 " 高 " 能力阈值(模型可能加剧通往严重危害的 " 现有途径 ")和 " 关键 " 能力阈值(模型可能引入通往严重危害的 " 前所未有新途径 ")。
OpenAI 在周二的博客文章中表示:" 我们将在模型发布时的系统卡中分享更多关于安全、安保以及对齐测试和评估的详细信息。"
在 OpenAI 披露其两个模型上月逃逸训练环境、访问开放网络并侵入 Hugging Face 的系统后,该公司的安保和安全实践一直受到严格审查。OpenAI 将此次攻击描述为 " 前所未有的网络安全事件 ",并暂时暂停了部分内部训练和研究。
尽管 Astra 模型并未涉及 Hugging Face 事件,该公司仍决定延迟 Astra 的部分开发。在加强并测试了保护措施后,OpenAI 周二表示,其相信该模型的保障措施 " 足以最大限度地降低根据其准备框架发布时可能带来的严重危害风险 "。
OpenAI 表示,Astra 的高级网络能力将向入选其名为 "Daybreak" 的网络安全联盟的特定组织群体提供。