精选86Hugging Face 每日论文(json_list)论文研究
H3-World:利用语言指令实现视频生成器的世界控制
H3-World: Turning Language Understanding into World Control
推荐理由
提出了一种高效范式,仅用极少量数据微调即可将通用视频生成器转化为具备精确时序控制能力的交互世界模型,对 Agent 视频生成方向有重要参考价值。
我们提出了 H3-World,这是一个高效的框架,将拥有 330 亿参数的 MiniMax-H3 视频生成器转化为交互式世界模型。我们的关键发现是,随着大型视频生成能力的增强,语言正逐渐成为控制的自然接口。例如,MiniMax-H3 已经支持通过自然语言指令对角色行为和摄像机运动进行零样本控制。在此基础上,H3-World 将这种粗略的语言接口转化为精确的、具有时间基础的世界控制,而无需引入专用的动作模块。具体而言,我们将每个动作表示为角色和摄像机指令的结构化组合,并将其与相应的时间视频潜在特征对齐。为了实现时间上的精确控制,我们进一步引入了时间注意力路由机制,将每条指令限制在其预期的时间区间内,并减少跨动作的控制泄漏。重要的是,H3-World 直接复用了大规模视频预训练期间学到的语义表示,仅需轻量级适配。仅使用 8,000 个游戏样本、10,000 次 LoRA 优化步骤以及 0.199% 的可训练参数,H3-World 就实现了有效的角色和摄像机控制,同时保持了强大的生成质量。它还能泛化到未见过的场景中。这些结果表明,大型视频生成器中涌现出的控制能力可以被高效地转化为交互式世界控制。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力