跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

EchoWM:可进入的全模态世界模型,支持720p视频与音频生成

EchoWM: Open and Enterable Omnimodal World Models

原文
发到 X

我们提出了EchoWM,一种用于可进入生成媒体的全模态世界模型,它能够响应连续导航,同时生成720p视频、环境声音、音乐和语音。我们围绕相机意图组织交互:在第一人称场景中,它指定观察者的运动,而在第三人称场景中,相机与角色的动态从数据中学习,无需特定视角的控制器。离散命令和连续姿态被映射到共享的度量尺度相对6自由度轨迹,通过数据集级别的校准保持异构数据间的运动幅度。为了联合学习音视频生成和轨迹控制,我们构建了一个互补的数据引擎,并采用渐进式训练,随后进行自回归后训练以支持长时程生成。广泛评估表明,该模型在公共世界模型基准上实现了强大的轨迹跟随和高视觉质量,支持不同主体的第一人称和第三人称交互,并在长时程生成中保持环境声音和语音的同步。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近