精选75Hugging Face 每日论文(json_list)论文研究
WarpSAC:面向可扩展离策略强化学习的探索与利用新方法
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
大规模并行仿真改变了离策略强化学习(RL)训练的数据环境,对为数据有限的回放而设计的稳定器提出了挑战。通过在八个基准家族中的受控实验,我们展示了这些稳定器依赖于数据环境:参数归一化有助于窄回放覆盖,但在数据丰富时限制了价值拟合,而裁剪双Q在高吞吐操作中可以放宽。年龄偏置的回放加权提高了跨环境的学效率,尤其是在网络容量有限的情况下。基于这些发现,我们提出了WarpSAC,一个环境感知的离策略RL算法家族。WarpSAC使用样本权重衰减进行高效利用,并提供两种变体:WarpSAC-L(归一化开启,裁剪双Q)用于数据有限的CPU规模训练,以及WarpSAC-A(归一化关闭,单Q)用于数据丰富的GPU并行训练。WarpSAC在九个CPU规模环境中将归一化得分-步长AUC比FlashSAC提高了4.5%,在十四个GPU并行环境中提高了23.1%。它将UnitreeG1TransportBox-v1的成功率从19.8%提升至96.4%,在MuJoCo Playground上将平均归一化墙钟时间AUC提高了19.1%,并在Unitree G1上实现了比FlashSAC快36.4%的仿真到现实部署。这些结果表明,可扩展的离策略RL应使其稳定器适应可用的数据环境。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力