跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

Agent-G²:高斯引导提升智能体强化学习效率

Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning

原文
发到 X

基于提示的强化学习通过在每个回合开始前保留专家轨迹的前缀,使策略能够从更接近成功的状态进行探索,从而解决长时程智能体任务中的奖励稀疏问题。其有效性取决于引导深度:即保留多少轨迹。现有方法将此深度视为确定性标量。调度方法在所有样本间共享一个值,忽略了每个任务的异质性;而逐样本探测则单独估计每个样本的深度,但代价是额外的回合。我们发现,有用的引导占据一个深度带,其信息量分布近似于以该带中心为中心的高斯分布,而非集中于单一最优值。我们提出Agent-G^2,一种高斯引导框架,它从已收集用于策略优化的回合中在线估计每个任务的深度,该深度服从高斯分布,其中心和散布均在线估计,无需探测回合或学习深度预测器。中心结合了全局基线与每簇难度,散布则跟踪簇内方差。我们在ALFWorld和WebShop上使用Qwen2.5-1.5B / 7B-Instruct评估了Agent-G^2。在ALFWorld上,Agent-G^2在不到逐样本探测三分之一回合成本的情况下,分别比最强的基于提示、无提示和Aux-RL基线高出2.3 / 3.9 / 7.4个百分点。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近