跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

AVA-Encoder:面向智能体的视频表示学习

AVA-Encoder: Towards Agent-Native Video Representation Learning

原文
发到 X

创意代理仍然缺乏从高质量人类电影中学习的有效方式,限制了它们制作电影级视频的能力。一个关键挑战是缺乏一种结构化的视频表示,这种表示既要忠实于电影内容,又要能直接用于代理的推理和操作。为了应对这一挑战,我们提出了代理视频自动编码器(AVA-Encoder),一种通过代理自动编码学习代理原生视频表示的框架。 AVA-Encoder将视频转换为知识图谱(KG)表示,然后将其重建回视频。其层次结构和状态节点存储结构化文本,而链接的资源层保存生成的图像、音频和视频。类型化边以代理易于理解、查询和编辑的形式保留了这些文本描述与资源之间的关系。视频重建差异驱动了一个文本梯度优化框架,该框架将评估反馈表达为自然语言更新方向,用于外循环中的数据无关编码策略伪训练,以及测试时内循环中可选的数据相关KG表示细化。 大量实验表明,AVA-Encoder比最强外部基线提高了20.7个百分点。在受控的仅策略设置中,其伪训练的镜头级代理视频编码器策略也优于精心人工调优的策略,同时使用的系统提示令牌减少了74.3%。我们发布了完整的AVA-Encoder框架、一个可靠的代理视频重建基准,以及第一个高质量电影KG表示数据集。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近