精选86Hugging Face 每日论文(json_list)论文研究
DIEM:强化微调中动态重要样本挖掘框架
Dynamic Important Example Mining for Reinforcement Finetuning
推荐理由
RFT 是当前提升模型推理能力的核心路径,这篇论文提出的动态样本挖掘机制提供了可复现的优化思路,值得跟进研究 RFT 效率的同学参考。
强化微调(RFT)正被越来越多地用于增强大模型的推理能力,但其效果受限于训练数据的选择与使用方式。大多数以数据为中心的 RFT 方法依赖于静态或启发式的样本选择,隐含地假设样本的价值在训练过程中是固定的。这忽视了策略学习中的非平稳动态特性,可能导致次优的更新。我们提出了动态重要示例挖掘(DIEM),这是一个原则性强且完全自动化的框架,使数据利用在整个 RFT 过程中保持自适应。DIEM 将两个组件集成到每个优化步骤中:(i) 一个基于梯度对齐的重要性估计器,可高效近似每个样本对策略改进的边缘贡献;以及 (ii) 一种约束批次重加权方案,在保持更新梯度幅度以稳定优化的同时最大化整体效用。在多个推理基准测试中,DIEM 始终优于强大的静态和动态基线方法。代码将通过 https://github.com/hrtan/DIEM 发布。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力