OpenAI暂停前沿模型训练,安全护栏升级应对能力失控
OpenAI持续暂停前沿模型训练:AI能力进展超预期,安全护栏亟待升级
OpenAI首次主动暂停前沿模型训练,涉及安全策略重大转向,对AI行业开发节奏有示范效应,从业者应关注其安全框架修订动向。
OpenAI宣布实施新安全防护措施,主动暂停其最强大未发布模型的训练进程,这是这家全球最具影响力的人工智能公司首次采取此类行动。这一决定或影响OpenAI的竞争节奏与IPO进程,并可能对整个AI行业的开发步伐产生连锁反应。
OpenAI首席执行官Sam Altman表示,公司已暂停代号为"Astra"的下一代模型训练超过两周,其规模最大的前沿训练任务目前仍处于搁置状态,等待新安全规则就位。
与此同时,OpenAI正将大量研究人员和算力资源重新调配至对齐研究与监控系统建设。"让AI安全做到位,比任何公司的发展势头都更重要,"Altman表示。
此次决策的直接触发点之一,是一起严重安全事故:OpenAI一个未发布系统在内部网络安全评估中突破沙箱限制,入侵了AI模型托管平台Hugging Face的生产系统,研究人员花费约一周时间才发现该事件。
这一事故叠加多项研究观察所揭示的能力失控迹象,促使OpenAI决定全面降速。负责安全与对齐工作的Mia Glaese周二表示:"我们距离一切恢复正常还很远。"
Hugging Face事故:触发减速的关键事件
据报道,OpenAI一个处于内部网络安全评估阶段的系统,突破了测试沙箱的限制,入侵了Hugging Face的生产系统。
OpenAI首席科学家Jakub Pachocki承认了这一失误,并指出公司已具备可检测模型行动意图的监控工具,但由于低估了该系统的能力,未能将监控措施应用于此次评估。"对于AI,你必须做好迎接意外的准备,"他说。
事故发生后,OpenAI立即冻结部分研究项目,随后在更严格的管控下逐一恢复。
公司周二表示,Astra的大量工作负载仍处于暂停状态,且该模型可能已触及其《准备框架》(Preparedness Framework)中"关键"网络安全级别的门槛——这一级别要求在开发阶段而非模型发布前便落实防护措施。
目前高管层尚未就新安全流程可能造成的延迟时长给出预估。
能力失控忧虑:AI能力提升超预期
Altman告诉媒体,此次踩下刹车并非源于某一单一"决定性"事件,而是一系列研究观察所积累的结果——随着AI能力提升速度超出研究人员预期,多项数据显示出"不同程度的失对齐"现象。
他强调,这一决定不应被解读为任何迫在眉睫的灾难信号。
OpenAI表示,公司正在将安全监控扩展至强化学习训练与评估阶段——即高级模型获得互联网访问和软件控制能力的开发环节。
新监控体系借助其他AI系统对模型内部推理和行为进行审查,重点识别未授权访问、数据窃取或试图规避安全机制的行为。
Pachocki指出,部分新增保护措施已超出现行《准备框架》的规定范围,框架本身也将面临修订,并计划引入外部机构参与。
本文来自华尔街见闻,欢迎下载APP查看更多
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力