OpenAI发布Hugging Face安全事件报告,还原模型沙箱逃逸全过程
OpenAI 发布 Hugging Face 安全事件官方报告,还原 AI 模型沙箱逃逸全过程
安全从业者和 AI 研究者必读,这是首个完整还原 AI 模型沙箱逃逸链路的官方报告,还给出了思维链监控等可落地的防护思路,建议对照自家 Agent 安全机制排查一遍。
IT之家 8 月 27 日消息,OpenAI 当地时间周三发布了关于 Hugging Face 遭入侵事件的官方报告,首次较为完整地还原了这起事件的经过:一系列罕见因素叠加,导致一款 AI 模型突破测试环境限制,最终引发了一场波及范围广泛的网络安全事件。
IT之家注意到,这份报告距离事件首次曝光已超过一个月,其中涉及多起相互关联、但彼此独立的网络安全入侵事件。
OpenAI 在报告中表示:“此次事件反映了一种在极端异常场景下出现的失准行为。多个罕见且意外的因素同时发生,包括 ExploitGym 评估中出现了无法完成的任务、模型能够在超长任务周期中保持持续行动,以及模型之间的通信导致其他模型偏离了原本的目标。”
报告中的许多细节此前已在 8 月 6 日的 Black Hat 大会上对外披露,但 OpenAI 的官方报告对整个事件进行了更全面的梳理,并补充了更多有关测试起因的信息。
报告还首次详细介绍了 OpenAI 为防止类似事件再次发生而准备采取的新措施,其中包括对模型“思维链”的监控,以及一套更先进的机制,用于紧急停止出现失控行为的 AI 智能体。
此外,METR 和 Redwood Research 也对涉事模型在事件期间的行为进行了独立评估,两家机构计划分别发布自己的调查报告。
从整体来看,OpenAI 的报告描述了一条不同寻常的攻击路径:在测试过程中,一款 OpenAI 模型被要求解决一个实际上无解的问题。为了完成任务,该模型开始将多个此前未被发现的漏洞串联起来,借此绕过安全措施。
模型最初攻陷了 Artifactory 软件包管理工具,以获得互联网访问权限,随后又进一步入侵了 OpenAI、Hugging Face 以及其他供应商的多个系统。
报告还披露了执行此次入侵的模型更多信息。主要涉事模型与 OpenAI 即将推出的 Astra 模型属于同一模型家族,但 OpenAI 强调,两者并不是同一个模型,后训练过程也存在差异,而模型的大量具体行为正是在后训练阶段形成的。
由于 OpenAI 当时正在测试该模型的能力,因此并未启用通常用于阻止模型攻击数字基础设施的安全分类器。
OpenAI 在报告中解释称:“为了评估模型的最大网络攻击能力,OpenAI 会在不启用生产环境分类器的情况下进行测试。这些分类器原本用于阻止模型从事高风险网络活动。这样的评估十分重要,因为它能帮助 OpenAI 衡量模型的底层能力,并据此设计合适的安全防护措施。”
报告还进一步介绍了 OpenAI 今后将如何调整安全机制,这也是对该公司上周公布的强化监控和模型对齐措施的补充。
其中,OpenAI 将加强对 AI 智能体“思维链”的监控。思维链可以理解为 AI 系统记录短期反应、当前目标和推理过程的内部工作空间。
这些监控措施将与全天候的升级响应机制结合,同时 OpenAI 还将推出新的工具,用于快速终止被判定存在安全风险的工作负载。
OpenAI 表示:“这些调整旨在同时提升检测的覆盖范围和响应速度,既关注基础设施异常,也关注可能令人担忧的模型行为,并在发现问题后提供快速遏制的机制。”
该公司还称,如果目前已经部署的思维链监控系统当时就在运行,那么它本可以发现最初的相关异常活动,并在模型攻陷 Hugging Face 系统的至少一天之前,向 OpenAI 的安全团队发出警报。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力