跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

Self-OPD:无需教师模型的流匹配模型在线策略蒸馏

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

原文
发到 X

在线策略蒸馏(OPD),利用预训练的专用教师模型提供密集监督信号,在大语言模型(LLMs)中取得了显著成功,并最近被应用于流匹配模型。然而,这种范式存在两个主要问题:首先,为每个新目标训练一个单独的任务特定教师模型会带来高昂的计算成本。其次,教师与学生分布之间的差异常常导致生成轨迹上的复合误差。在本文中,我们引入了Self-OPD,一种针对流匹配模型的无教师OPD框架,将学生自身的自我探索转化为逐步监督。在每个时间步,Self-OPD将确定性下一状态预测分支为K个随机SDE候选,使用ODE采样器进行展开,并将其奖励与确定性自参考基线进行比较以获得归一化优势。速度场通过全分支拉推目标进行优化,其中高优势分支吸引学生,低优势分支在方向感知衰减和SDE方差归一化下排斥学生。对于多目标对齐,Self-OPD在奖励级别融合归一化分数,避免直接梯度冲突。在单一和混合奖励基准上的实验表明,Self-OPD在无需任务特定教师的情况下优于先前的RL和OPD方法。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近