精选75Hugging Face 每日论文(json_list)论文研究
MemUse:将长期人机对话记忆评估从直接问答转向自然融入
MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
对话式LLM的记忆系统通常通过关于先前对话的直接事实性问题(直接问答)进行评估:模型能否从先前的对话中回忆起事实X?我们在为期4个月的部署中(40名用户,1,872个会话,7种记忆条件)测试了更高的直接问答准确率是否与更高的用户满意度相关。现有基准的直接问答在7种条件下从19.7%到70.1%不等,但满意度没有变化。我们假设现有基准和用户满意度追踪的是不同的能力:基准衡量的是诱发回忆(被问及时回忆),而对话需要自然整合(检测相关性并自然地将先前上下文编织到响应中)。为了检验这一点,我们引入了MemUse,一组从部署中提取的真实用户提示的记忆时刻,通过整合感知的判断对自然对话响应进行评分。在保持模型和上下文不变的情况下,同一系统在直接问答上得分78.8%,但在对话中仅引用了这些事实的7.9%——差距达71个百分点。在这些时刻中,自然整合与满意度相关,而直接问答则不然。我们发布了部署语料库和MemUse,连同所有判断和评分提示,网址为https://github.com/ryuichi-sumida/memuse。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力