跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

环境正则化打破LLM策略优化的稳定性-探索困境

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

原文
发到 X

大型语言模型的策略优化(PO)面临稳定性与探索之间的权衡,目前通过动作侧的策略KL正则化来调节。这使实践者陷入两难境地:保持策略KL会约束响应行为并消耗动作侧的探索预算,而放弃它则使优化缺乏明确的漂移控制。我们提出了一种替代方案,通过将正则化移至输入侧来打破这一困境。随着训练的进行,当前策略在训练查询上的分布从其预强化学习的参考分布无控制地漂移。 具体而言,环境正则化策略优化(ERPO)引入了一个查询KL(QKL)项,用于限制这种查询分布漂移,同时结合一个基于数据集静态参考的逐查询权重,该权重将每个查询的更新偏向于参考分布下典型的查询。QKL梯度严格通过查询似然流动;策略梯度估计器使用的响应得分函数不出现在QKL项中,因此QKL不会对响应分布产生直接的梯度压力——探索得以保留。ERPO可无缝集成到GRPO/PPO/REINFORCE风格的流程中,无需额外的前向传播。在六个数学推理基准上,ERPO替代了标准的策略KL正则化器,同时有效控制查询分布漂移,在高温度解码和长时程训练下提供更强的准确性和显著更稳定的行为。我们的源代码可在 https://github.com/alibaba/ERPO 获取。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近