S3Gym:LLM能否通过自测与自评实现自我改进
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
大型语言模型(LLMs)越来越多地与外部环境交互并积累大量的行为经验,然而现有的智能体基准测试大多将它们视为固定策略进行评估。因此,尚不清楚智能体是否能够主动测试其行为、评估由此产生的经验,并利用这些经验来改善未来的决策。我们引入了 S\textsuperscript{3Gym},这是一个用于评估 LLM 通过三种耦合能力实现自我改进的交互式基准测试:自我测试(Self-Testing)、自我评判(Self-Judging)和自我改进(Self-Improvement)。S^3Gym 将宽松探索与严格的保留集评估分离开来,并在七个带有可执行环境验证器的文本游戏中实例化了这一协议。我们评估了整合交互经验的三种路径:直接历史上下文学习(History ICL)、基于分数的摘要记忆(Summary Memory)以及参数训练(Training)。 我们的实验表明,自我改进既不是自动发生的,也不是均匀一致的。上下文层面的经验提升了某些模型-游戏组合的性能,但最有效的路径强烈依赖于任务结构:当经验可以被压缩为可复用的战略规则时,摘要有益;然而,当成功取决于精确的状态依赖信息时,摘要往往不如原始历史记录表现好。参数训练在某些任务上带来了显著的提升,但在其他任务上也表现出不稳定的改进和严重的负迁移现象。这些发现表明,仅仅识别成功的动作是不够的;智能体还必须将反馈转化为可执行且可迁移的策略。S^3Gym 提供了一个统一的框架,用于诊断这一过程并识别阻碍智能体将交互经验转化为可靠自我改进的瓶颈。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力