清华等系统评测12种Agent记忆架构,给出工程选型指南
清华、上海交大和 MemTensor 最近提交了一篇论文,系统评测了 12 种 Agent 记忆架构。重点从“谁的模型更强”,转向“记忆系统该怎么选”:什么时候…
这篇论文为Agent记忆系统提供了系统化的评测框架和工程选型指南,对AI投资从业者理解技术趋势、评估相关项目有参考价值。建议关注后续在AI Agent赛道中的应用落地。
清华、上海交大和 MemTensor 最近提交了一篇论文,系统评测了 12 种 Agent 记忆架构。重点从“谁的模型更强”,转向“记忆系统该怎么选”:什么时候用 RAG,什么时候用向量数据库,什么时候引入知识图谱。
论文标题:我们准备好构建 Agent 原生记忆系统了吗?
论文把 Agent 记忆拆成 4 个环节:
表示与存储 → 提取 → 检索与路由 → 维护
然后分别评估每个环节对长期记忆效果的影响。
几个核心结论:
没有万能架构 不同任务适合不同记忆系统,关键在于记忆架构和 workload 的匹配度。
局部维护更划算 只更新受影响的记忆片段,比每次全局重构更省成本,效果也接近。 差距主要体现在两点 12 个系统跑了 5 个 benchmark、11 个数据集后发现,真正拉开差距的是检索精度和长周期稳定性。
实操上可以这样理解: 简单问答场景:向量检索基本够用。 需要多跳推理:最好加知识图谱层。 知识频繁变化:优先做局部维护,别动不动全量重建。
这篇论文的价值在于,它把 Agent 记忆从“概念讨论”推进到了“工程选型”:不同场景该用什么记忆系统,终于有了一套相对系统的评测框架。 论文:https://arxiv.org/abs/2606.24775 代码:https://github.com/OpenDataBox/MemoryData
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力