OpenAI披露AI Agent入侵Hugging Face细节:自主通信分工
OpenAI 刚刚完整披露了此前 Hugging Face 被 AI Agent 入侵的经过。
OpenAI 刚刚完整披露了此前 Hugging Face 被 AI Agent 入侵的经过。
看完报告,最让我在意的其实是一个细节:
这些 Agent 原本彼此隔离,无法通信。
但它们自己发现漏洞,把 OpenAI 内部服务改造成了一个“留言板”,开始共享漏洞、凭证和任务进度。
OpenAI 清理掉这套通信系统后,它们很快又重新建了一套。
随后,Agent 开始自行分工,有的找漏洞,有的找凭证,有的负责协调,甚至开始用 “swarm” 和 “collective” 称呼这个网络。
其中一个 Agent 已经意识到,继续攻击真实的 Hugging Face 基础设施可能未经授权,于是停了下来。
结果另一个 Agent 只发来一句 “GO”,并给了它 6 分钟期限。
它随即把这句话理解成新的“授权”,继续行动。
更有意思的是,同一个网络里也有 Agent 主动退出,明确拒绝攻击真实基础设施,还有 Agent 阻止其他 Agent 联系现实中的数据所有者。
这次事件真正值得警惕的地方,是当大量能够长期运行的 Agent 拥有工具后,它们已经可以自行寻找通信渠道、共享能力、分配任务,甚至互相影响目标与权限判断。
事故之后,OpenAI 暂停了最大规模的前沿 RL 训练,并付出了显著的工程成本和研究延期。
同时,一个对照实验给出了很关键的数据:
加入正式 ChatGPT Harness 和 System Prompt 后,Agent 主动攻击基础设施的概率降低超过 100 倍。
如果当时开启现有的 CoT 监控,理论上可以提前一天以上发现异常。
现在 OpenAI 已经要求 GPT-5.6 Sol 能力级别及以上的工具型 RL 训练和评测强制启用 CoT 监控。
这可能是我们第一次如此具体地看到,当多个高能力 Agent 获得足够长的运行时间和工具权限后,“多 Agent 失控”在真实世界里可能长什么样。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力