精选75Hugging Face 每日论文(json_list)论文研究
BPCO:稳定训练评论家模型替代GRPO的强化学习新配方
Best Practice Critic Optimization
基于组的强化学习方法(如用于大语言模型的GRPO)通过为每个提示采样多个响应来避免训练评论家。可靠的评论家反而可以从单个响应中估计令牌级优势,但标准的基于评论家的训练方案往往不稳定。我们研究了这种不稳定性,并开发了最佳实践评论家优化(BPCO),这是一种结合了DPPO、值预测限制在奖励范围内、蒙特卡洛值目标、未归一化的策略优势以及长度自适应广义优势估计的方案。由于评论家仅在训练期间使用,BPCO还可以将其条件化为奖励定义信息,例如参考答案或评分标准,这些信息对策略是隐藏的。受控实验隔离了每个设计选择的效果。在从1.5B参数到30B-A3B混合专家的数学推理任务中,BPCO一致地改进了强大的基于评论家的基线,并在每个提示采样一个响应的情况下达到或超过基于组的基线。同样的方案也改善了基于评分标准的奖励学习。这些结果表明,精心设计的评论家为组相对优势估计提供了可靠的替代方案。代码可在 https://github.com/QPHutu/golden_critic 获取。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力