VibeLifeBench:评估生活智能体的主动性与持久性
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
大型语言模型(LLM)智能体正越来越多地被部署为个人助理。然而,现有的评估大多使用静态环境中的简短、自包含请求。日常生活辅助则不同。任务持续数周而非数分钟。在智能体未被提示时,世界持续变化。许多约束从未明确说明。仅仅回答眼前请求的智能体将在这样的任务中失败。相反,需要的是一个保持主动性和一致性的智能体。它自行决定何时行动、何时询问、何时保持沉默。它注意到无人宣告的变化。它从第一天到最后一天保持一个连贯的计划。没有现有基准衡量这一点。我们引入VibeLifeBench,一个涵盖十个日常生活领域的200个长时程任务的基准。每个任务是在一个包含22个模拟服务的模拟世界中的脚本化多周时间线。世界按自己的时钟推进,且许多变化是无声的,因此只有重新检查世界的智能体才能发现它们。每个任务通过细粒度、加权的检查进行评分,这些检查只读取智能体实际留下的内容,涵盖最终状态、其行动的及时性以及是否遵守了隐含约束。我们评估了七个前沿模型。它们得分都很低,这表明当前智能体距离辅助现实生活还有多远。我们将开源所有任务、环境和评估框架。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力