精选86Hugging Face 每日论文(json_list)论文研究
EnvHarness:通过插件组件实现智能体与环境的协同进化
EnvHarness: Awakening Static Worlds for Agent Learning
推荐理由
Agent 训练常受限于静态环境,这篇论文提出的 EnvHarness 提供了一种无需重写底层逻辑即可动态调整环境难度的通用方案,并在多个基准上验证了有效性,对 Agent 训练工程有直接参考价值。
大语言模型(LLM)智能体通过与环境交互进行学习,然而这些环境是手工构建且静态的:它们对智能体的弱点视而不见,并且随着智能体的进步很快就会被抛在身后。尽管最近的环境生成方法试图解决这一问题,但它们需要特定领域的流水线,依赖昂贵或不可靠的验证器,并且仍然产生静态环境。为了减轻从头重建环境的工程负担,我们提出了 Environment Harness(EnvHarness),这是一种可编程的插件组件层,它包装一个静态环境以重塑其行为,而无需修改底层逻辑。EnvHarness 通过标准接口运行,适用于各个领域,同时确保每个重塑后的环境都保留其原始验证器。为了实现这一过程的自动化,我们引入了 EnvRigger,它将目标策略视为黑盒,观察其执行轨迹以合成针对诊断出的缺陷的 EnvHarness 组件,并通过新的 rollout 进行验证。在四个领域的五个基准测试中,EnvHarness 优于原始环境和特定领域的环境生成流水线,在未见的实例上实现了高达 9.0 分的提升,且执行步骤减少了 9.8%。此外,EnvHarness 为强化学习提供了更优的优化信号,使得策略与其环境能够持续、有针对性地进行协同进化。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力