精选75Hugging Face 每日论文(json_list)论文研究
DreamX-Phi 1.0:机器人操作视频世界模型
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
我们提出 DreamX-Phi 1.0,一个用于机器人操作的动作条件视频世界模型,给定观察帧、语言指令以及包含末端执行器姿态和夹爪状态的预定动作序列,预测未来的观察结果。然而,仅凭逼真度并不能保证忠实性:一个令人信服的推演仍可能移动错误的手臂或丢失被操作物体。为确保预测尊重每只手臂的命令路径,我们通过 PRoPE 风格的几何编码将每只手臂的 SE(3) 变换注入注意力机制,保持手臂身份和刚体运动结构。仅靠动作控制并不能完全约束场景几何或小型被操作物体的演化。因此,我们添加了一个轻量级深度分支用于场景级几何,并使用带有冻结 V-JEPA 教师的 SAM3 掩码来保持抓取过程中的物体一致性。我们进一步通过分布匹配蒸馏将多步生成器蒸馏为少步学生模型,以实现高效部署。在撰写本文时,我们在 WorldArena 2.0 挑战赛的 Track 1 中取得第一名,在 Track 2 中取得第二名。我们的模型和代码将公开提供。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力