跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

并行管解码将视频时空定位延迟降低79倍

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

原文
发到 X

时空视频定位(STVG)要求模型识别所指事件发生的时间,并在该时间间隔内定位目标实体。现有的多模态大语言模型通常以自回归方式序列化生成密集的定位轨迹,导致解码延迟随管长增加而增长,并允许定位错误随时间传播。我们引入了并行管解码(PTD),这是一种生成式公式,将定位分解为一个时间块,随后是同时解码的基于时间的空间块。这消除了标记级和轨迹级依赖,将顺序解码深度减少到固定的1+1轮,与管长无关。为了实现并行空间生成,我们引入了解耦块注意力,它保留了对共享视频查询上下文的访问,同时消除了跨框依赖,并引入了用于时间边界和空间几何的定位感知策略优化。在VidSTG上,与标准自回归解码相比,PTD将管完成延迟减少了79倍,并将空间解码吞吐量提高了92倍,同时提高了定位准确性。凭借紧凑的4B骨干网络,我们的模型在VidSTG和HC-STVG上表现良好,并零样本泛化到时间定位、接地视频问答和指代视频对象跟踪。我们的结果表明,并行管生成是视频中自回归定位的一种高效且有效的替代方案。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近