跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

EditaLive:面向直播的实时角色视频编辑框架

EditaLive! Unified Character Video Editing for Live Streaming

原文
发到 X

传统视频编辑主要聚焦于场景级内容,而直播则更强调人物主体。然而,将现有的视频编辑方法直接应用于以人为中心的直播仍具挑战性,因为它们可能引入面部表情不一致的问题,并且通常依赖多次离线推理步骤,不适合实时交互。我们提出了EditaLive,一种用于实时流媒体角色视频编辑的新框架。具体而言,我们从预训练的图像动画模型(Wan-Animate)出发,该模型自然地将外观与运动解耦,并通过参考帧编辑和视频重建,利用收集的CharEdit-50K数据集,将其重新定位为基于指令的以人为中心的视频编辑基础模型。此外,我们将模型从离线双向适应为因果流式生成,并设计了一种对齐的自展开蒸馏策略,将模型压缩为两步采样器,其中固定的RoPE和对齐强制减少了训练与推理之间的差异,而首帧保留的稀疏注意力过滤冗余历史信息以减轻外观漂移。大量实验表明,EditaLive在忠实保留面部表情和低延迟实时流式推理方面,提供了最先进的编辑性能。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近