精选75Hugging Face 每日论文(json_list)论文研究
AutoSaddler:从Agent执行轨迹自动优化外部框架,提升长程任务可靠性
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLM智能体在长时程任务上仍然不可靠,在这些任务中,小的局部失败可能会在长时间交互中累积,导致整体任务失败。尽管外部框架可以大幅提升鲁棒性,但框架设计仍然是一个手动且昂贵的过程,需要在大量提示词、工具配置和控制逻辑的空间中进行搜索。我们提出了AutoSaddler,一个自动框架优化框架,它将框架改进形式化为一个离线学习问题,并利用小批量中的失败信号迭代更新框架。AutoSaddler结合了失败轨迹诊断、将框架视为代码的结构化补丁生成以及基于验证的更新选择。在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上的实验表明,AutoSaddler在相应基础框架上大幅提升了智能体性能,分别取得了9.0、9.6和10.0个百分点的增益。消融研究进一步表明,有效的框架优化受益于三个要素:深度调试而非浅层反思、有针对性的修改而非无约束编辑,以及泛化感知的选择而非轨迹特定的修复。综合来看,这些结果表明自动框架优化是通往更高效、更可靠的智能体系统的一条有前景的路径。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力