精选88Hugging Face 每日论文(json_list)论文研究
Chain-of-Experience:利用推理时迭代反馈实现大模型持续改进
Chain-of-Experience for Continual LLM Improvement
推荐理由
揭示了测试时利用反馈进行自我修正的新范式,数据详实且具通用性,值得研究者关注推理时的动态优化机制。
人类能够从经验中持续学习,而传统的大语言模型(LLM)评估则忽略了模型通过推理时交互进行改进的能力。在本文中,我们研究 LLM 如何在测试时从迭代经验中学习,我们将这种设置称为“经验链”(Chain-of-Experience, CoE)。在该设置下,模型通过与自身或环境反馈的迭代交互积累经验轨迹,从而形成超越零样本推理的持续改进循环。我们通过多种反馈机制实例化了 CoE,包括模型自我反馈以及正确性或公共编码测试通过率等环境信号,并使用包括 GPT-5、Gemini-2.5 Pro 和 Claude-4.5 Sonnet 在内的 8 个 LLM,在数学、编码和知识领域进行了评估。我们的研究表明,利用迭代经验始终优于无反馈基线,仅依靠自我反馈就能实现显著提升,同时在各项任务与模型上实现了 5.6% 的整体提升,并将 API 成本降低了 19%。我们进一步表明,结合互补的反馈渠道(例如模型反馈与正确性信号)能带来额外收益,且 CoE 在每个 token 上的准确率高于现有的测试时策略。我们观察到 LLM 的基础能力与其改进潜力之间存在正相关关系,并表明模型在弱反馈或虚假反馈下仍保持稳健,不同的反馈对不同的改进方面有所贡献,且大部分收益出现在迭代的早期阶段。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力