精选75Hugging Face 每日论文(json_list)论文研究
GUI-CC:评估GUI世界模型作为Agent环境的上下文一致性
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments
GUI世界模型越来越多地被评估为单步下一屏幕预测器,但其预期用途通常是作为GUI智能体的多步环境。这种不匹配导致一个关键需求未被充分测试:当生成的状态被反复用于未来交互时,它们必须保持上下文一致性。我们引入了GUI-CC,这是一个基准测试,旨在将GUI世界模型作为智能体环境而非孤立的下一屏幕预测器来评估其上下文一致性。GUI-CC包含两个互补的赛道:离线参考动作赛道,沿真实的移动GUI轨迹运行模型;以及在线智能体循环赛道,让固定的探测智能体与模型生成的UI进行交互。我们从GUIOdyssey构建了500个离线轨迹任务,并在30个移动应用中构建了200个经模拟器验证的在线任务。GUI-CC评估转换保真度、转换合理性、上下文一致性和任务进度。实验表明,合理的单步生成并不能保证可靠的环境模拟:当前模型经常产生看似可用的屏幕,却无法保留与任务相关的上下文或支持可执行的多步展开。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力