跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

AdaPop:按流行度自适应的大模型遗忘方法

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

原文
发到 X

在预训练期间,流行事实比罕见事实被记忆得更深,且在移除时抵抗性更强,然而现有的LLM遗忘方法无论训练数据频率如何,都施加统一的梯度压力。我们提出AdaPop(自适应流行度)方法,该方法将局部令牌置信度与从外部代理(如Wikidata站点链接、LLM作为评判者)得出的基于事实流行度的指数相结合,并通过双上升控制器自动调整遗忘-保留平衡,该控制器每个训练周期调整保留惩罚。在三个模型家族和两个基准测试中,AdaPop在释义查询下泄露的遗忘内容比竞争方法少约5倍,在对抗性改写下少约1.6倍。我们通过内部指标支持我们的分析:在我们的方法下,遗忘集隐藏状态比在其他方法下更远离预遗忘模型的隐藏状态,而保留集表示保持接近。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近