跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

HuggingFace论文:通过影响导向蒸馏解决采样Token策略蒸馏的多样性

Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation

原文
发到 X
推荐理由

深入剖析了蒸馏过程中的多样性丧失机制,提出的IDA-OPD方案在降低计算成本的同时有效继承了教师模型的分布特性,对追求高效蒸馏效果的团队有直接参考价值。

采样令牌在线策略蒸馏(OPD)利用学生生成的令牌,高效地将能力从教师模型迁移到学生模型,且仅需教师对采样令牌的概率。然而,它经常遭遇多样性蒸馏失败的问题:学生的 pass@1 指标提升,但 pass@k 指标停滞不前,未能继承教师的多样性。为了解释这一现象,我们引入了“一阶局部熵影响”(First-Order Local Entropy Influence),这是一个带符号的一阶代理变量,它将每次更新的熵效应解耦为教师与学生之间的对数概率差以及学生的局部概率结构,并通过实证将熵收缩与负影响位置联系起来。受此启发,我们提出了“影响导向自适应在线策略蒸馏”(IDA-OPD):该方法不依赖昂贵的全词汇前向 KL 散度目标,而是保留扩展熵的更新,同时用发散自适应优势缩减来替换收缩熵的更新,且仅使用教师对采样令牌的对数概率。在面向推理的蒸馏实验表明,IDA-OPD 持续提升了 pass@k 指标,通过蒸馏继承了教师的多样性,以严格更低的成本达到了最强教师信息方法的水平,并广泛保持了原始 OPD 的 pass@1 性能,且全程无需全词汇的教师信息。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近