精选75Hugging Face 每日论文(json_list)论文研究
EM^2Mem:面向大模型的以事件为中心的多模态记忆框架
EM^2Mem: Event-Centric Multimodal Memory for Large Language Models
多模态记忆为长视频问答提供了可扩展的接口,但现有方法通常检索字幕、帧、转录文本、摘要或图事实作为孤立片段。尽管这些片段可被搜索,但它们并非直接可用于生成:语言模型必须在推理时重建跨模态和时间对齐,而此时上下文有限且归因困难。我们提出了 EM^2Mem,一种以事件为中心的多模态记忆框架,在记忆构建过程中将异构证据绑定到事件锚点上。每个按事件索引的记忆单元都对齐多模态记录、时间上下文、图链接关系、语义事实和来源信息,从而能够在基于真实多模态事件的基础上进行紧凑的证据读取,而非特定模态的孤立片段。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线平均准确率分别提升了 2.0、2.4 和 3.7 分;严格的事件级 Top-5 证据召回率提升了 7.0 分;每次查询的延迟降低了 4.67 倍,总推理 token 数减少了 63.66%(代码将整合至 https://github.com/zjunlp/LightMem)。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力