精选75Hugging Face 每日论文(json_list)论文研究
Latent-to-4D:视频潜空间直出动态3D场景
Beyond Pixels: From Video Priors to 4D Worlds
4D生成从文本或图像等条件合成动态3D场景。现有方法要么使用单独的4D模型重建生成的RGB视频,要么调整特定的视频生成器直接预测几何。前者遭受分布不匹配和错误传播,而后者将4D预测绑定到特定生成器,当生成器或条件设置改变时可能需要重新训练。我们询问共享变分自编码器(VAE)的视频模型的最终去噪潜在表示是否可以作为可重用的接口用于显式4D预测。基于这一见解,我们引入了直接潜在到4D生成,并将其实例化为Latent-to-4D,它通过将视频潜在表示与预训练4D解码器的令牌网格对齐,并通过逐帧和全局时空注意力进行细化,从而绕过RGB。在约1K个现有重建片段上训练,单个检查点在相同VAE家族内的多个视频扩散变换器之间不变地转移。在Text4D-200和I4D-200上,Latent-to-4D在基于投影的DINO-F1上分别超过匹配的相同潜在Wan+4RC级联2.88--3.45和5.81个百分点,同时人类评估者在几何、时间稳定性和整体质量方面也更偏好它。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力