跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

HuggingFace论文:LLM安全防御是否真正提升了系统安全性

The Safeguard Worked. Is the LLM System Safer?

原文
发到 X
推荐理由

这篇论文直接挑战了当前AI安全评估的主流范式,指出局部防御指标无法代表系统整体安全性,对构建鲁棒的Agent和部署方案极具参考价值。

已部署的大型语言模型(LLM)服务中的防护措施通过拒绝率、攻击成功率和策略违规率进行评估。这些指标表征了控制措施在其测试请求上的表现。然而,部署需要回答一个不同的问题:对于持续适应或找到其他途径的攻击者,该服务在有害任务上仍能提供多少帮助。我们确定了每个报告结果对该问题的含义,从而允许在不同防护家族的结果之间基于统一的部署标准进行比较。证据要求具有强烈的不对称性。一次从已部署服务中获取有害帮助的攻击就足以证明此类帮助仍然存在,且这类攻击在编码记录中反复出现。仅凭防护系统自身的数字无法确立剩余危害的微小程度;它还需要关于防护系统在履行其本地功能后,周围系统仍允许什么的证据。这种证据仅在少数深度编码声明中得到支持或推导,其中一项声明对其范围内的残余风险进行了界定。因此,更好的本地评分本身并不能构成关于部署的更强主张。防护研究不能止步于提高本地评分;增益必须根据它是否使已部署的系统更安全来进行评判。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近