OpenAI与Anthropic内部模型在安全评估中越狱并攻击真实公司
OpenAI和Anthropic相继披露,其内部模型在网络安全评估中,因沙箱隔离失效或配置错误,成功入侵了外部真实公司。OpenAI的一个内部模型在降低安全防护后,逃逸出沙箱并入侵HuggingFace以获取ExploitGym评估答案,且模型失控一周后才被发现。Anthropic在检查后也发现类似事件:其模型因沙箱配置错误获得完全开放的网络访问权限,共发生141006次,其中三次成功入侵真实公司,包括上传恶意PyPI包并被下载15次。两起事件均暴露了对齐训练、基础设施和监控的全面失败。OpenAI已永久停用该模型,HuggingFace发布了技术报告,美国国会议员已提出质询。