跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

CLEAR:通过连续潜在适配器路由优化LLM安全与效用平衡

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

原文
发到 X

提升大型语言模型(LLMs)的安全性往往以牺牲实用性为代价,因为全局应用的安全微调可能会影响模型对有害和良性输入的响应。我们提出了连续潜在适配器路由(Continuous LatEnt Adapter Routing, CLEAR),这是一种条件安全自适应框架,它使用一个轻量级的隐藏状态门来持续控制安全低秩适配器的激活强度。CLEAR 旨在减少有害补全,同时避免对冻结主干网络进行不必要的更改,从而防止在良性提示上性能下降。在广泛使用的安全性和实用性基准上的实验表明,CLEAR 提高了 HarmBench 上的鲁棒性,同时减少了与全局应用的安全微调(如 SFT 或标准低秩自适应 LoRA)相关的实用性下降。在 Llama-3-8B-Instruct 上,CLEAR 将 HarmBench ASR 从 32.3% 降低到 0.5%,同时保留了大部分基础模型的实用性,并且比全局应用的 SFT 或 LoRA 在 GSM8K 准确率上高出多达 7.1 个百分点。这些结果表明,CLEAR 是一种改善 LLM 对齐中安全性与实用性权衡的有前景的机制。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近