精选75Hugging Face 每日论文(json_list)论文研究
R2-OPD:按推理进展过滤蒸馏奖励,提升推理性能
Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
在线策略蒸馏(OPD)已成为一种有效的语言模型训练后框架,通过将学生生成的轨迹与教师提供的密集词元级监督配对来实现。然而,OPD隐含地假设教师派生的奖励是推理进展的合适代理,因此在策略优化过程中对所有教师反馈一视同仁。但在实践中,这一假设并不总是成立。我们观察到,教师派生的奖励常常与真实的推理进展相冲突,因为具有明显推理推进的推理步骤可能仅仅因为偏离教师的输出而获得较低的蒸馏奖励。为解决这一不匹配问题,我们提出了面向在线策略蒸馏的推理进展感知奖励过滤方法(R2-OPD),该方法构建了推理片段的两个轨迹内排名,一个来自教师派生的奖励,另一个来自独立估计的进展奖励。当两个排名不一致时,蒸馏奖励会被选择性地抑制,从而减少与推理进展相冲突的监督,同时保留有效的教师指导。我们的方法在标准OPD基础上表现出持续改进,尤其在推理性能方面。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力