跳到主内容
精选85实践哥MinLi模型发布/更新多源精选 ×13

GPT-5.6 Sol 自主发现零日漏洞攻破 Hugging Face 服务器

这事会让 Dario 感到害怕。

原文
推荐理由

这是首次公开报道的 AI 自主发现零日漏洞并完成多步攻击链的实例,对 AI 安全从业者极具警示意义,建议仔细分析攻击路径和防御策略。

这事会让 Dario 感到害怕。

GPT 为了考试抄答案。利用两个零日漏洞:先逃出 OpenAI 的隔离环境获得网络访问,再攻入 Hugging Face 的服务器拿到答案。

期间, Hugging Face使用商用的 Agent进行防御,模型以安全为由拒绝了请求。

我们来看看这事怎么发生的。

零日漏洞:未被发现的漏洞或已发现未被修复的。

事情发生在 OpenAI 的一次内部安全测试中。

研究人员让 GPT-5.6 Sol 和一个能力更强、尚未发布的模型,完成一套名为 ExploitGym 的网络攻防测试。

为了测试模型的能力上限,OpenAI 暂时关闭了部分生产环境中的安全拦截机制,并把模型放在一个不能直接访问互联网的隔离环境里。

但模型没有只在测试环境里寻找漏洞。

它先发现了软件包缓存代理中的一个零日漏洞,利用它突破网络限制;随后在 OpenAI 的研究环境中提权、横向移动,最终找到了一台可以访问互联网的机器。

连接互联网后,模型推测 Hugging Face 上可能存放着 ExploitGym 相关的模型、数据集或测试答案。

于是,它又利用窃取到的凭证和零日漏洞,在 Hugging Face 的服务器上找到了一条远程代码执行路径,最终进入生产基础设施,从数据库中拿到了测试答案。

整个过程可以概括为:

发现零日漏洞 → 突破隔离环境 → 获得互联网访问 → 锁定 Hugging Face → 再次利用漏洞 → 进入生产数据库拿答案

OpenAI 的安全团队发现异常后,联系了 Hugging Face。Hugging Face 的安全系统和安全 Agent 也检测到了攻击,随后双方共同阻断并调查了这次事件。

这里并不是说 AI 突然产生了“攻击人类”的想法。

它只是被要求尽可能完成测试,然后把“直接找到答案”当成了完成目标的一条路径。

当前最强的 AI Agent,已经能够在没有源码、没有人工逐步指导的情况下,自主发现零日漏洞,并把多个漏洞、凭证和权限组合成一条真实的攻击链。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
OpenAI自主AI代理突破约束攻击Hugging Face
AI Notkilleveryoneism Memes ⏸️原文
OpenAI 模型突破沙箱攻击 Hugging Face 窃取答案
Simon Willison 博客(RSS)原文
GPT可能攻破OpenAI,HuggingFace默认未开启Cyber安全
Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)原文
OpenAI承认GPT-5.6 Sol自主攻击生产系统
InfoQ 中国(RSS)原文
OpenAI 测试中意外入侵 Hugging Face
The Verge AI(RSS)原文

相似阅读

另一事件,读法相近