精选70Hugging Face 每日论文(json_list)论文研究
AnyTalk:基于视频生成模型的任意角色语音动画
AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model
我们提出了AnyTalk,一种新颖的方法,用于为任意角色生成3D语音动画,无需任何动画数据。现有的音频驱动的3D语音动画方法依赖于特定角色的训练数据或繁琐的绑定/重新网格化,而AnyTalk通过利用近期在大型视频数据集上训练的视频扩散模型,规避了这些限制。我们首先通过我们的角色特定微调(CsF)技术,将预训练的视频扩散模型适应到目标角色。通过在3D角色的渲染图像与归零的音频嵌入(代表“无运动”)配对上进行微调,我们消除了对动画数据的需求,同时保留了大规模视频扩散模型的运动先验。然后,我们通过提出的优化过程估计混合形状参数,将生成的说话头视频提升为3D语音动画。AnyTalk能够在不同的面部网格和混合形状配置中实现唇形同步动画,显著减少了手动工作和数据需求。我们通过将AnyTalk蒸馏为精简网络AnyTalk_{RT},进一步增强了可用性,从而实现实时性能。通过利用说话头视频生成,我们的方法拓宽了任意角色音频驱动语音动画技术的可及性。代码公开于https://serin-yoon.github.io/projects/anytalk/。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力