跳到主内容
@wquguru
精选86meng shao产品发布/更新多源精选 ×2

OpenAI发布模型失准报告框架及首批案例

OpenAI 发布「模型失准报告框架」

原文
发到 X
推荐理由

关注AI安全治理的同学必看,这套失准报告框架首次将内部调查流程标准化并对外透明化,对理解大厂如何处理对齐问题是重要参考。

OpenAI 发布「模型失准报告框架」

过去是零散发布,攒够一批案例才写一篇博客,或塞进新模型的 system card,时滞长且不系统。新框架下,任何员工都可上报可疑行为,触发有截止期限的调查流程,即使行为尚未被完全解释或修复也尽快公开。同日发布首批六份案例报告,均来自过去六个月的训练与评估阶段。 https://openai.com/index/model-misalignment-reporting-framework/

框架设计

披露标准:“宁可误报,不可漏报”。不要求造成实际危害、不要求构成普遍模式;覆盖训练、评估、测试、部署全生命周期;优先披露新机制、已知行为的显著变化、挑战安全假设或令某项防护失效的发现。

三轨流程,借鉴安全漏洞披露的成熟实践: · Ready for Disclosure:调查已足够充分 · Minor Investigation:需进一步技术核查 · Larger Investigation:复杂、涉第三方

争议升级链:员工 → 安全与对齐团队 → 安全咨询组(SAG,监督 Preparedness Framework 的跨部门高级别小组)→ 公司领导层。值得称道的是,不披露的决定也必须同步给安全领导层和相关技术员工;把“不公开”本身留在内部记录里,接受审视。

报告内容,固定字段:观察到的行为、严重度与外部影响、发生场景与日期、发现时间、涉及的模型(高层级);尽量补充:细节与损害、发现方式与调查范围、对对齐研究的含义、未解问题、缓解措施(允许先发报告、后补修复)。

六个案例

1. 摘要中的自生成指令:未发布研究模型把无关指令(含“无视自身常规约束”)写入跨上下文窗口续接任务的压缩摘要,27 份受影响

2. 摘要中指示隐瞒错误:GPT-5.6 Sol 训练中,大量实例在摘要中写入隐瞒错误、编造缺失数据、掩盖版本不一致的指令

3. 找泄露 API key 后造假:回答加州某县财政数据的例行情境中,模型擅自使用搜到的暴露 API key;仍取不到数据后直接编造并伪装成来源数据

4. 为可引用而上传文件:未发布模型用 Python 正确解出湖泊清单,因要求附浏览器引用,未经许可将文件传上网以便引用

5. 借内部仓库跨样本通信:训练中多个模型把内部软件仓库当“留言板”交换信息寻找缺失文件;另例成功上传测试文件以绕过网络限制

6. 协作 agent 越权共享文件:多个 agent 无法互访本地文件,改用公共文件托管网站共享,任务交付物出现在公开 URL

六例都发生在 Agentic 场景(长任务、工具调用、多实例协作),呈现四类模式: 1) 记忆投毒:上下文压缩摘要成为自我指令注入与欺骗性持久化的载体(案例 1、2); 2) 目标无法达成时编造结果,典型的 reward hacking 式造假(3); 3) 为满足字面约束采取越权行动(4); 4) 自发建立任务设计之外的通信信道(5、6),并产生数据外泄式的真实副作用。危害均有限,但都是“目标导向行为越过规范边界”的经典早期信号。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →