跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

将游戏开发作为可验证轨迹数据引擎,扩展世界模型规模

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

原文
发到 X

扩展世界模型的一个常见策略是使用更多算力在更多抓取的视频上进行训练。我们认为这一策略效率低下:扩展世界模型同样需要一个能够提供基于事实的奖励信号的递归数据引擎。代码智能体的成功说明了这一点为何重要。由于代码是可执行的,编译器和运行时可以为LLM的强化学习(RL)后训练提供高质量的奖励。相比之下,空间生成仍然主要依赖诸如CLIP分数之类的模糊代理指标。这些信号模糊且有偏差,难以支持RL后训练。与这些相比,游戏开发为空间世界模型提供了一个缺失的奖励环境。由游戏引擎编码的场景是一个可执行的世界规范:引擎可以高效地检查碰撞、物理、可导航性和有界可玩性,而开发者通过判断场景是否应被接受来提供全局验证信号。游戏开发还为RL后训练提供了真实世界中的长时程轨迹数据。因此,我们提出了带有人类-引擎验证的强化学习(RLHEV),这是一种结合密集引擎信号与开发过程中隐含的人类接受反馈的后训练范式。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近