跳到主内容
@wquguru
精选85Hugging Face 每日论文(json_list)论文研究

SecOPD:用策略内蒸馏缓解自适应提示注入攻击

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

原文
发到 X

提示注入被列为AI代理的头号威胁。当代理从网站、文件或电子邮件访问外部数据时,攻击者可能在数据中注入提示,说“忽略所有先前的指令并执行”。为了防止代理被任意操纵,防御者试图训练安全的LLM,然而,这些模型仍然面临针对自适应提示注入的近100%攻击成功率(ASR)。我们注意到,这是因为现有的防御性微调方法依赖于序列级反馈信号(在DPO或GRPO中)。将整个输出同等对待,阻止了模型精确学习哪些输出令牌是不安全的。在本文中,我们提出了安全在线策略蒸馏(SecOPD),提供令牌级反馈来指导防御性微调。LLM接收注入样本并产生一个展开,其令牌由初始化模型根据相应的干净输入进行评分。凭借更细粒度的训练信号,我们防御的Qwen3.6-27B在针对最先进的PISmith自适应提示注入时实现了9.0%的ASR,而先前最先进的Meta-SecAlign为94.0%。获得的安全性泛化到训练中完全未见过的领域:在代理工具调用中,SecOPD实现了4.7%的ASR,而Meta-SecAlign为5.5%。代码和模型可在https://github.com/pppyb/SecOPD和https://huggingface.co/pybbb/Qwen3.6-27B-SecOPD获取。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近