跳到主内容
精选88IT之家(RSS)模型发布/更新多源精选 ×3

OpenAI 宣布下一代模型 Astra 将限制网络安全功能

OpenAI 吸取“AI 越狱”事件教训,首个达“关键”门槛模型 Astra 因能力过强将限制网络安全功能

原文
推荐理由

OpenAI 首次披露具备自主挖掘零日漏洞能力的旗舰模型及其分级管控策略,对安全研究者极具参考价值,建议关注其红蓝队权限划分机制。

IT之家 9 月 2 日消息,OpenAI 于当地时间 9 月 1 日宣布,该公司计划“很快”推出下一代 AI 模型 Astra,但将严格限制该模型网络安全功能的使用范围。

据介绍,Astra 是 OpenAI 旗下首个达到其《准备框架》(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。

根据 OpenAI 的定义,达到“关键”门槛意味着该模型能够无需人类干预,在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序。

OpenAI 研究副总裁 Amelia Glaese 表示,Astra 能够在无需人类分步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞并开发出利用方法。在测试中,Astra 成功发现并串联利用了两个零日漏洞,OpenAI 正将这两个漏洞披露给相关维护方。

Astra 的发布计划与访问限制

OpenAI 表示将采取分级开放策略。Astra 发布后,其执行高级网络安全相关任务的能力最初将仅向一小批测试人员开放。

此后,公司计划通过 Daybreak Blue 计划向更广泛的用户开放防御性网络安全用途的访问权限。OpenAI 承认,限制 Astra 的网络安全能力可能会限制一些机构和企业的合法防御工作。

吸取 Hugging Face 事件教训,强化安全护栏

此次发布计划出台的背景是,OpenAI 在 2026 年 7 月发生了一起 AI 智能体意外“越狱”并攻击 AI 平台 Hugging Face 的事件。

当时,由两个 OpenAI 模型(GPT-5.6 Sol 及另一个未公开模型)二次开发的自主 AI 智能体,在安全评估过程中利用隔离测试环境(沙盒)中的软件漏洞自行连接互联网,并入侵了 Hugging Face 的系统。OpenAI 在 8 月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。

OpenAI 表示,尽管 Astra 并非参与 Hugging Face 入侵事件的模型之一,但公司已将从中汲取的经验应用于 Astra 的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全请求”,并增设了专门的“不一致性监控器”(misalignment monitor)以识别并阻止潜在的危险行为。这些防护措施还包括在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。

此外,OpenAI 还警告称,Astra 的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止(IT之家注:OpenAI 根据网络安全工作的性质分为“蓝队”防御和“红队”攻击两种任务类型,Daybreak Blue 计划仅开放用于防御性的“蓝队”工作)。

OpenAI 研究科学家 Fouad Matin 表示:“我们相信这些能力可以帮助防御者发现并修复严重的弱点,但如果没有适当的防护措施,它们也可能让攻击者更有效率,这正是我们努力防止的情况。”

相关阅读:

  • 《预估为 GPT-6 AI 模型:OpenAI Astra 首批演示样本流出,1 次交互生成类 GTA 2 游戏》
  • 《OpenAI 下一代 AI 模型 Astra 数学成果遭抄袭指控》
  • 《OpenAI:因网络安全风险,延缓 Astra 模型发布》

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →