跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

MemTrapBench:评估大模型记忆引发的认知陷阱

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

原文
发到 X

记忆已成为大语言模型的关键组成部分,使其能够保留信息并从长期交互中学习。然而,现有的记忆基准测试主要评估信息是否被正确提取、存储和检索,而很大程度上忽视了检索到的记忆如何重塑模型的推理过程并影响当前任务的性能。我们发现了由记忆引发的认知陷阱:即使是被忠实记录且语义相关的记忆,也可能扭曲模型的推理或信念,并降低当前任务的性能。为了系统性地评估这些失效模式,我们引入了 MemTrapBench,它涵盖了两种形式的认知陷阱:推理固着(Reasoning Fixation)和信念扭曲(Belief Distortion)。在两个模型系列和五个代表性记忆框架上的实验表明,MemTrapBench 具有挑战性:所有评估的记忆策略表现均不如无记忆设置,即使是性能最强的方法也出现了超过 10% 的性能下降。为了缓解这些认知陷阱,我们提出了 AdaptiveMem,这是一种简单但有效的推理时方法,指导大语言模型避免陷入记忆陷阱。AdaptiveMem 在 MemTrapBench 上缓解了认知陷阱,同时在各种记忆框架下的标准记忆基准测试中保持或提升了性能。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近