跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

RecVerse:基于分层记忆与轨迹强化学习的电商用户行为仿真

Towards Faithful Simulation of Human Shopping Behavior

原文
发到 X

在电商场景中,模拟真实的用户购物行为是离线评估和强化学习的基础。尽管近期基于大语言模型(LLM)和多模态视觉语言模型(VLM)的模拟器取得了令人鼓舞的进展,但复现真实的浏览会话仍然面临两大困难:(i) 记忆挑战:一个购物会话跨越数十个页面,而现有的智能体要么丢弃长程观察历史,导致丢失不断演变的用户状态;要么简单地拼接这些历史,从而撑爆上下文窗口,甚至降低仿真质量。(ii) 优化挑战:当前的用户模拟器通常通过模仿学习或步骤级奖励进行监督训练,以匹配每条日志记录的动作;由此生成的会话往往表现出不切实际的模式,例如过度探索或过度被动,而基于单步的监督既无法检测也无法纠正这些问题。 为了解决上述挑战,我们提出了 RecVerse,这是一个基于 GUI 的仿真智能体,它通过截图感知页面并生成忠实的多轮轨迹。针对记忆挑战,RecVerse 采用了一种受认知科学启发的分层记忆机制:工作记忆(Working Memory)用于短期聚焦,情景记忆(Episodic Memory)用于会话内的轨迹记录,偏好记忆(Preference Memory)用于高层意图,并将记忆更新视为动作,使智能体能够自适应地学习何时以及记住什么。针对优化挑战,RecVerse 采用轨迹级强化学习目标进行优化,对整个会话进行评分,使其在宏观层面的动作类型分布和微观层面的购物意图上均与真实用户保持一致。我们还发布了 USB(User Simulation Benchmark),这是一个用于多轮用户仿真的交互式电商 GUI 轨迹数据集。实验表明,RecVerse 在行为保真度和意图一致性方面均显著优于现有基线方法。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近