精选75Hugging Face 每日论文(json_list)论文研究
OPDVR:融合可验证奖励的在线策略蒸馏方法
On-policy Distillation with Verifiable Reward
基于可验证奖励的强化学习(RLVR)和同策略蒸馏(OPD)已成为大型语言模型后训练中两种广泛采用的范式。然而,RLVR面临稀疏的任务级反馈问题,而OPD提供密集的令牌级指导但忽略了轨迹的正确性,将其性能限制在教师模型水平。将两者结合是一个有前景的方向:OPD提供密集的监督信号,而RLVR提供任务级正确性。尽管如此,现有的集成方法往往依赖于加权组合或启发式切换,引入了额外的超参数和权衡。我们提出了基于可验证奖励的同策略蒸馏(OPDVR),这是一种简单而有效的方法,无需添加任何超参数即可无缝结合OPD和RLVR。我们首先基于轨迹正确性重新表述采样令牌OPD的隐式奖励,然后应用ReLU门控机制,确保正确轨迹获得非负奖励,错误轨迹获得非正奖励——从而将蒸馏信号与任务成功对齐,同时保留教师的分布指导。此外,我们的修改将采样令牌OPD转化为一种合适的RLVR方法,使其易于与任何策略梯度算法(如GRPO)结合。在六个推理基准上的实验表明,OPDVR始终优于标准OPD。我们的代码可在 https://github.com/LeapLabTHU/OPDVR 获取。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力