精选70Hugging Face 每日论文(json_list)论文研究
Ex-Omni-2D:带原生视觉呈现的全模态对话模型
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
全模态对话模型能够理解多模态输入并合成语音回复,然而它们的回复在视觉上仍然是无实体的。我们提出了Ex-Omni-2D,一个全模态对话框架,它生成包含文本、个性化语音和参考条件视频的协调响应。给定多模态查询、参考图像和参考音频,模型预测一个结构化的视觉思维计划(VTP),描述场景、情感和动作,随后生成响应文本和原生多码本语音单元。这些单元形成一个共享的声学-时间接口:它们被解码为语音并与视频帧在线对齐。该接口使得响应和虚拟形象路径能够从异构的语音、对话和虚拟形象视频数据中学习,避免了对大规模查询-文本-语音-视频监督的需求。一个全序列视频生成器作为主要教师。为了高效的增量生成,我们进一步将其蒸馏为少步块因果流式学生,其前缀流式机制在连续块之间携带干净的潜在表示,以减少累积的后期块退化。通过四步推理,完整的四GPU流水线在400×720/720×400分辨率下实现了端到端RTF为1.293,提供了一个实用的质量-效率操作点。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力