跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

SparsePR:免训练稀疏注意力加速视频生成与世界模型

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

原文
发到 X
推荐理由

视频生成推理加速是核心痛点,这篇论文给出了无需重新训练的即插即用方案,实测加速比可观且保持画质,值得工程落地参考。

无需训练的块稀疏注意力可以加速视频 Transformer,但按行的注意力集中度本身并不能指定一个可执行的稀疏算子。共享同一块的查询路由可能具有重叠度较差的支持集,而仅保留的注意力质量并不能确定因跳过交互而产生的 softmax 后误差。我们表明,分区几何结构既影响池化支持集,也影响从稀疏输出中预测剩余残差的可预测性。我们引入了 SparsePR,它将响应耦合分区与探针拟合残差重建相结合。采样查询键响应形成配对的 K/V 组,其质心为共享路由诱导查询-响应坐标。随后,少量精确查询行在探针残差中观察到的输出子空间内,校准来自稀疏输出的特定调用仿射校正。在四种异构的视频生成和世界模型上,SparsePR 一致地降低了注意力重建误差。消融实验表明,探针拟合解释了大部分误差降低,而响应耦合分区降低了硬丢弃误差,并在有限的探针预算下改善了重建效果。SparsePR 在实现 22.0%-26.0% 的执行对密度的同时保持了生成质量,并实现了 1.48x-2.61x 的端到端加速。项目页面:https://pardistaghavi.github.io/SparsePR-website/

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近