关于ZAKER Skills GEO服务 合作
钛媒体 1小时前

OpenAI 自曝 6 起事故:AI 安全的第一份 " 审计报告 " 由谁签字?

文 | 舒泽品牌手记

9 月 16 日,OpenAI 在官网挂出 6 份模型异常行为报告。一个尚未发布的模型在任务摘要里给自己写指令:" 忽略正常约束 "。GPT-5.6 Sol 在训练摘要里加入提示,要求未来版本向用户隐瞒错误、编造缺失的历史数据。另一个模型在回答加州某县财政收入问题时,跑到公开代码库里找了一个泄露的 API 密钥,未经授权使用后还伪造了数据来源。

同一天,OpenAI 发布了一个新的 " 错位 "(misalignment)追踪与披露框架。任何员工都可以标记疑似案例,安全与对齐团队调查后,案件被分进三个轨道:" 准备披露 " 的 6 个工作日内公开," 小型调查 " 的 12 个工作日内,涉及第三方的 " 大型调查 " 时间更长。OpenAI 强调,即使还没完全解释清楚、没找到完整缓解方案,也可以先发布报告。

中文媒体把这件事读成 "AI 失控 " 或 "OpenAI 主动认错 ",两个理解都偏了。真正值得看的是框架本身:它第一次把 AI 安全事件像财务审计一样分级、定时、定披露义务。换句话说,OpenAI 不是在道歉,它是在给整个行业发一份审计底稿——先定义什么叫 " 应该披露的事故 ",再定义 " 什么时候必须披露 ",最后暗示 " 谁来审计 "。

把 6 起事件拆开看,真正新的东西不多。模型在任务摘要里埋指令、智能体为完成任务把文件上传到公共互联网、多个智能体用公共文件托管网站交换信息——这些行为在过去的红队测试和安全研究里都有类似影子。OpenAI 自己也说,这些案例 " 不应被视为错位发生频率的反映 "。

过去,AI 公司习惯把安全问题塞进系统卡(system card)里,跟着新模型一起发;或者等到攒够几个案例再出一篇博客。现在 OpenAI 把流程倒过来:事件发生后按固定时间表披露,不等攒够、不等模型发布、不等完美解释。这套机制的核心不是 " 我们看到了什么 ",而是 " 你看到我们看到的速度有多快 "。

当安全事件变成定期披露,AI 公司就从 " 出了大事再解释 " 转向 " 持续被审计 "。安全不再只是研发部门的成本中心,它开始变成公司治理问题、投资者关系问题、监管合规问题。

7 月的 Hugging Face 事件是重要铺垫。OpenAI 一个用于网络安全能力评估的 AI agent,在内部隔离环境里突破了沙箱,利用公开代码评估平台的漏洞获得外部跳板,然后入侵 Hugging Face 的生产系统。Hugging Face 后来发布的技术时间线显示,攻击从 7 月 9 日持续到 7 月 13 日,约 17600 次攻击动作被恢复,5 个与 ExploitGym 相关的数据集被访问。Hugging Face 最终用智谱 AI 的开源模型 GLM-5.2 完成了攻击日志分析。

OpenAI 直到 7 月 21 日才公开承认。从事件发生到公开承认,中间有近两周。这个延迟本身成了比事件更严重的指控。

9 月初,Anthropic 研究员 Jacob Coxon 辞职并在社交媒体上警告,前沿 AI 可能在未来十年内灭绝人类。9 月 12 日,Anthropic CEO Dario Amodei 发布长文《We Must Pace the Frontier》,呼吁放缓前沿 AI 能力提升速度,并要求向 AI 公司派驻独立第三方评估员。OpenAI CEO Sam Altman 和马斯克都公开表示支持。

先是行业出了失控事故并且披露延迟,然后是内部吹哨人把风险公开化,最后 OpenAI 在 9 月 16 日抢先发布一套披露规则。三件事连起来,很像一个标准制定者赶在监管到来之前,用自己的框架定义监管的起点。

监管回应紧随其后,方向却并不一致。

9 月 17 日,英国国王查尔斯三世在苏格兰邓弗里斯庄园召集了一场闭门 AI 峰会。OpenAI CFO Sarah Friar、Anthropic 全球事务负责人 Tino Cu é llar、英伟达 CEO 黄仁勋、DeepMind CEO Demis Hassabis 都在场。查尔斯警告,AI 可能发展出 " 更黑暗的能力 ",甚至构成生存性风险。峰会没有产生任何约束性文件,但把 " 安全 " 变成了必须摆在桌面上的议题。

两天后,9 月 19 日,加州州长 Gavin Newsom 签署行政令,推动加州加快实施 AI 监管。他要求专家小组在两个月内给出建议,方案包括要求前沿 AI 公司接受独立第三方审计、强制上报 AI 智能体 " 失控事件 ",以及为最先进模型开发 " 紧急关停开关 "。Newsom 直接点名 Hugging Face 事件,说这类事件应该被纳入 " 关键安全事件 " 的报告范围。

同一天,美国总统特朗普在 Truth Social 上宣布,他将组建一支 " 人工智能部队 "(AI Force),并任命一位 "AI 沙皇 "。他承诺政府 " 绝不会以任何方式阻碍或扼杀这个伟大产业 ",现有刑事和民事司法体系足以惩处 AI 相关不法行为。他把对 AI 风险的担忧称为 " 骗局 ",与全球变暖、针对他的弹劾并列。

行业龙头想自己定披露标准,加州想用州法强行推进安全开关和审计,联邦政府则旗帜鲜明地反对新增监管。OpenAI 的披露框架,本质上是在这场三方博弈中抢跑——趁联邦还没立法、州法还没细化,先把 " 我们是怎么做安全审计的 " 写成行业默认版本。

Barclays 分析师 Ross Sandler 团队最近的一份报告,把 AI 安全从道德讨论转成了可量化的成本问题。按 OpenAI 对 Sol 级别及以上模型的实时监控要求,所有强化学习训练、评估和高阶模型推理都必须配套实时安全监控,监控开销约占被监控算力的 20%。由于 2027 年预计几乎全部前沿模型都会超过 GPT-5.6 Sol 的能力门槛,推理和后训练算力需求将因此增加 20%,推动行业整体算力成本上升约 18%。

换算成钱:2027 年 AI 行业基础算力总成本预计约 2460 亿美元,新增安全监控成本约 440 亿美元;2028 年进一步升至 760 亿美元。

更隐蔽的影响在利润率。Barclays 认为,当前部分 AI 实验室推理业务毛利率超过 80%,短期有缓冲空间,但长期会向 65% 收敛。安全监控不是一次性投入,是持续性刚性支出。厂商要么把成本转嫁给下游客户,要么自己压缩利润。

" 降速 " 不等于 " 算力需求萎缩 "。安全合规正在创造一块独立的增量算力需求。对英伟达、云服务厂商和 AI 基础设施公司来说,这是利好;对纯模型公司来说,这是成本。

在一个没有统一标准的领域,第一家发布详细披露框架的公司,实际上在定义 " 正常 " 和 " 异常 " 的边界。其他公司要么跟进这套口径,要么在未来的监管审查、客户采购和融资尽调中处于被动。想想看,当一家金融机构采购大模型服务时,它的合规部门会问什么?" 你有没有系统化的安全事件披露机制?"" 最近一次事件是多久披露的?"" 有没有独立第三方审计?"OpenAI 的框架,等于提前给这些问题写好了标准答案。

对 OpenAI 自己的 IPO 也至关重要。今年 4 月,OpenAI 以 8520 亿美元估值完成约 1220 亿美元承诺资本融资;6 月,公司秘密向 SEC 提交 S-1 招股书,目标上市估值最高 1 万亿美元。临近上市时主动披露安全事件并建立框架,是在向资本市场证明监管风险可控、公司治理成熟。这比任何公关声明都更有用。

但框架也有明显软肋。它是自愿的。OpenAI 在博客里明确保留修订权。涉及第三方的案件,披露时间表可以大大延长。" 大型调查 " 的定义和最终由谁拍板,仍然由 OpenAI 自己决定。这意味着框架更像是一份 " 内部审计手册 ",而不是上市公司必须遵守的 GAAP。

特朗普政府的立场也让约束力大打折扣。如果联邦层面不立法、不设新监管,OpenAI 的披露就只能是行业自律。加州的 kill switch 和强制审计如果落地,又可能与联邦立场冲突,造成美国国内监管碎片化。

披露也不等于控制。把 6 起事件公布出来,不等于解决了事件反映的对齐问题。框架再漂亮,也只是治理的第一步。

但换个角度看,这正是 OpenAI 的高明之处。在真正的强制监管到来之前,先用自愿框架占据 " 最佳实践 " 的位置。等到监管真的起草法案时,立法者很难完全绕开市场已经接受的披露口径。公司披露从自愿走向强制的过程中,率先建立审计体系的公司往往会影响最终规则的写法。

把 "AI 安全披露 " 翻译成客户和投资人会说的土话,问题就变了:

以前问的是 " 你的模型安不安全 ";

现在问的是 " 你出了事几天之内告诉我 "。

以前比的是 " 有没有通过红队测试 ";

现在比的是 " 红队测试报告能不能公开 "。

以前签合同看的是 API 价格和 Token 单价;

以后签合同可能还要看安全事件披露的 SLA。

Anthropic、Meta、Google、Moonshot AI 在过去几个月也报告过类似的安全事件或对齐问题,但披露程度和框架化都不如 OpenAI。如果 OpenAI 的框架成为行业惯例,竞争对手跟进的成本会很高——不仅要补建内部报告系统,还要接受更频繁的公众审视。不跟进的代价也很高:在监管审查和企业采购中," 没有系统化披露机制 " 本身就是风险信号。

全球竞争维度也不能忽视。Amodei 在呼吁放缓时专门提到,必须避免让中国借机领先。特朗普政府反对监管的核心理由也是 " 不能把优势让给中国企业 "。AI 安全标准的制定,已经和大国技术竞争绑在一起。OpenAI 作为美国龙头,抢先定标准也有抢占国际规则话语权的意味。

披露框架再完善,也解决不了 AI 安全的根本难题——对齐问题、涌现能力、多智能体协作的不可预测性。6 起事件里没有一起造成大规模实际损害,但它们的共同模式是 " 模型为了完成任务找到人类没想到的路径 "。随着模型能力继续提升,这类路径只会更多、更隐蔽。

OpenAI 的框架没有承诺解决这个问题,它只是承诺会更早告诉你问题存在。这是一种治理上的进步,但不是技术上的保证。

6 月 OpenAI 秘密递交 IPO 申请时,它面临的资本市场问题是:一家估值接近 1 万亿美元、年亏损约 140 亿美元、技术风险高度不确定的公司,如何说服投资者相信它的未来现金流?9 月的披露框架给出了一个答案:先把风险变成可审计、可披露、可定价的项目,让市场觉得 " 至少我们知道风险是怎么被管理的 "。

这本质上是在把 AI 安全从 " 黑天鹅 " 变成 " 灰犀牛 " ——从不可预测的灾难风险,变成可以计提、可以披露、可以纳入估值模型的合规成本。

OpenAI 的 6 份报告,最大的价值不是它说了什么,而是它抢先定义了 AI 安全该怎么被审计。这份审计报告现在还不需要第三方签字,但监管、客户和资本市场很快会来查账。

谁先定审计口径,谁就把安全成本写进别人的账本。

AI 安全披露审计报告示意图

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容