精选85OpenAI News(RSS)论文研究
奖励模型过度优化的缩放定律
OpenAI 发布关于奖励模型过度优化的缩放定律研究。该研究探讨了在强化学习中使用奖励模型时,过度优化(overoptimization)现象如何随模型规模、数据量等缩放。研究发现,随着优化强度增加,奖励模型预测的奖励与真实奖励之间的偏差会增大,且这种偏差遵循幂律缩放关系。研究还提出了一种基于 KL 散度的正则化方法,可有效缓解过度优化问题。该工作对训练大规模语言模型时的奖励建模和强化学习具有重要指导意义。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力