跳到主内容
@wquguru
精选88meng shao产品发布/更新

腾讯开源T-Mem:用联想触发器突破长对话记忆检索盲区

腾讯团队开源发布会"预演"的记忆系统「T-Mem」

原文
发到 X
推荐理由

Agent开发者的必读工程实践,详细拆解了如何用Trigger机制解决长对话中“词不达意”的记忆召回难题,参数与流程清晰可落地。

腾讯团队开源发布会"预演"的记忆系统「T-Mem」

当前四代长期记忆架构:Flat RAG、图结构记忆(GraphRAG、Zep、HyperMem)、agentic 层级记忆(Mem0、A-Mem、MemoryBank)、操作系统式记忆内核(MemGPT、MemOS、MIRIX),虽然结构各异,但检索配方却完全相同:把查询和存储内容投进同一个相似度空间(BM25 或稠密向量),取 top-K。这决定了一件事:记忆的"可达性"被相似度封顶。

论文:https://arxiv.org/abs/2606.15405 开源项目:http://github.com/Sherlockwz/T-Mem

现在的问题是什么?

现有记忆架构的检索配方只覆盖一半情形。当查询与记忆共享表面特征时(同样的措辞、同一个实体、同一个时间地点)它工作良好,这就是描述性召回。但长对话里还有同样常见的另一半:查询与记忆零表面重合,绑定二者的只有一条潜在的语义弧,比如因果关系、同一情境的延续。这是联想性召回。比如:一个月前用户说过"团队里有人严重海鲜过敏",今天问"今晚团队去哪儿吃饭",两句话没有任何词汇重合,前者却恰恰是后者的必答依据。长对话中的用户极少用原措辞重提旧话题,而借新情境的间接线索回访记忆;表面形式已经漂远的目标,永远无法从同一个相似度邻域里到达。

把"粒度"(单条事实 / 完整对话段)和"取向"(描述性 / 联想性)作为两个正交轴,就得到 2×2 检索设计空间。论文指出,现有系统全部挤在第一、第四象限(描述性的一半),第二、第三象限,联想性的一半,是这套检索配方的结构性盲区。也是腾讯这篇论文的基础。

核心思想:把"预演"放在写入时

T-Mem 的答案借自认知科学。人在回忆过去时,会为未来的线索预演经验,这叫"情景未来思维"。它的工程对应物就是 trigger:写入记忆时,由构建用的大模型离线算好并随宿主存放的一条预测,"这条记忆会在什么情境下重新变得重要"。

trigger 的架构意义在于解耦了两件事:一条记忆"如何被到达"和"什么算答案证据"。当相似度找不到宿主时,查询仍可以经由宿主的某条 trigger 命中它。每条记忆因此同时保有描述性入口和联想性入口。四个 trigger 家族各占设计空间的一个象限: · Entity Trigger(第一象限,事实×描述):给原子事实一个上位概念名。"海鲜过敏"的实体触发器可能落在"饮食限制"上。 · Bridge Trigger(第二象限,事实×联想):把事实投射到一个"知道它就会有用"的具体情境,并附一步推理的理由。过敏事实投射到"为团队晚餐选餐厅"。这是纯联想轴,相似度检索完全无法覆盖。 · Scene Trigger(第四象限,场景×描述):从情境、对象、事件、情绪四个正交属性各用一句话描述当前场景。 · Horizon Trigger(第三象限,场景×联想):把同一场景投射到一组前瞻维度,让未来的查询从相关但不同的情境接近时仍能命中它。

其中 Entity 和 Scene 服务的是相似度检索已经覆盖的那一半,Bridge 和 Horizon 才是填补盲区的两族。

结构与流程

记忆被组织成五类对象的类型化图:scene(按事件闭合切分的连贯对话段,作为证据)、item(从 scene 抽取的原子事实,可锚定到多个源 scene 以承载跨场景的逻辑链)、topic 标签(只用于限定抽取范围和检索预过滤,明确不进入问答通道)、四族 trigger(只参与检索,永不出现在证据里),以及按说话人聚合的 persona(作为环境上下文附在证据之后,不占用检索预算)。三条设计承诺:证据层按类型隔离、topic 不污染问答、trigger 不进入证据路径。

构建是四阶段离线流水线,顺序承重:按事件闭合(而非会话边界,会话边界是数据采集的副产品,一个会话可含多个事件、一个事件可跨多个会话)切分 scene;按到达顺序做 topic 归组,一个 scene 可加入多个 topic;每个 topic 一次抽取,同时产出原子 item 和跨场景连接 item;最后逐节点生成 trigger,Entity 与 Bridge 在同一次模型调用中产出。

检索是自上而下的 topic→scene→item 三级瀑布,每层用 RRF 融合词法与稠密排序。最关键的一处工程细节是:经由任一 trigger 到达的 scene 和 item 不受 topic 预过滤的闸门约束。预过滤本质是基于相似度的邻域测试,而 Bridge 和 Horizon 恰恰是为邻域之外的线索设计的;让它们过闸,等于把 T-Mem 自己要对抗的相似度体制重新加回来。item 级 trigger 召回另带 0.85 的硬余弦阈值。trigger 索引采用多视图编码:每个 item 暴露纯概念、纯桥接、联合(概念∥桥接∥理由)三个视图,取跨视图的最大余弦分并归属到宿主。整套检索在 CPU 上即可完成,单台无 GPU 工作站可复现全部评测。

实验结果

LoCoMo 官方协议下,T-Mem 总准确率 80.26%,超最强基线 HyperMem(官方协议复跑值 77.01%)3.25 个点,token F1 51.96 同向;分题型为单跳 85.97、多跳 69.15、时间 82.55、开放域 55.21,其中开放域以 0.69 点惜败 MemOS,是唯一未拿第一的题型。

真正的分水岭在 LoCoMo-Plus 的 Cognitive 子集(专门剥离词汇重合、探测纯联想召回的题目):T-Mem 74.81%,HyperMem 48.63%,MemOS 32.67%,GPT-4o 直接读完整对话原文零样本也只有 21.05%,Gemini-2.5-Pro 为 26.06%。跨基准落差方面,T-Mem 只掉 5.45 个点,其余系统掉 28.38 到 50.07 个点;连 GPT-4o 吃下全部原文也掉 45 个点,说明骨干模型的规模救不了联想轴的断裂。作者自己划的重点是:跨基准落差而非单榜绝对分才是这项工作的 headline。

消融实验是全文最有信息量的部分,且信息不在总分而在两列的不对称。描述轴组件(scene 层、item 通道、Entity+Bridge、persona、topic 过滤)在 LoCoMo 上各值 1.4 到 4.7 个点,在 LoCoMo-Plus 上却只值 0.25 到 2.99 个点;联想轴组件完全反过来,去掉 Horizon Trigger,LoCoMo 只动 0.08 个点,LoCoMo-Plus 塌 12.47 个点,两个场景级 trigger 一起去掉塌 22.19 个点,是任一描述轴开关影响力的七倍以上。这条不对称本身就是论证:只按相似度基准调优的系统,隐含地就在优化"待在相似度邻域之内",而邻域之外的成本,这类基准在构造上就测不到。

效率上,构建是一次性离线成本:10 段 LoCoMo 对话共 9,689 次构建模型调用、15.60M token,高于 Mem0 的 12.20M,作者把增量明确归给 Bridge 和 Horizon 两族联想 trigger,称之为扩展联想轴的价格。答题时的 token 预算低于 HyperMem 的同时两个基准都更准;低 token 阵营(Mem0、Zep、MemOS)在 LoCoMo-Plus 上直接崩盘。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件