精选80Hugging Face 每日论文(json_list)论文研究
PILOT 框架实现长时程 Agent 在线自改进,性能提升显著
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
长时程智能体运行产生的经验既能改进当前运行,也能促进未来工作。多数自我改进方法仅在执行结束后处理这些经验,因此无法调整正在进行的运行,也无法立即应用并验证从中获得的教训。我们认为自我改进应当实时进行,利用涌现的经验既调整当前运行,又更新持久化工具链。现有智能体架构并未完全支持这一目标。单智能体自我纠错将任务执行与轨迹评估置于同一上下文中,而子智能体委派虽分离了执行,但通常无法调整正在进行的子智能体。我们提出PILOT,一种用于实时自我改进的监督者-工作者工具链,通过两种耦合机制实现:(1)实时引导使独立的监督者能在执行过程中调整或中止正在工作的智能体;(2)实时自我进化将执行过程中显现的程序与失败模式提炼为可复用的技能与记忆。在两种固定骨干模型和三个基准测试中,PILOT在六种配置中的五种中排名第一。在Terminal-Bench 2.0上,PILOT比对照工具链高出最多9.8个百分点。在自我改进场景中,PILOT在GLM-5.1上提升14.6个百分点,在Kimi-K2.6上提升12.4个百分点。平均输出令牌数分别下降42.9%和47.4%,而每百万输出令牌的成功评估次数分别上升110.3%和134.0%。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力