精选86Hugging Face 每日论文(json_list)论文研究
论文:滑动窗口注意力优于线性注意力
Sliding-window beats linear attention
推荐理由
直接挑战线性注意力的主流叙事,用实证数据证明滑动窗口是更低成本、更高性能的长上下文方案,对架构选型有直接参考价值。
由于二次注意力机制的特性,大型语言模型(LLMs)消耗大量的内存和能量。每个新标记的开销都比前一个更大。对于每个额外添加的标记,键(keys)和值(values)必须无限期地存储在内存中,这是不可持续的。 为了解决二次扩展问题,人们提出了几种替代方案,其中一种是将 LLMs 改造为使用线性注意力(Linear Attention)。鉴于这一方法有望以低成本解决二次扩展问题并保持最先进的性能,它引起了广泛关注。然而,这类研究并未与更简单的基线方法进行充分比较。 在本研究中,我们表明带有 sink 的滑动窗口注意力(Sliding Window Attention, SWA)在性能上至少等同于甚至优于经过后训练的线性注意力模型。我们在多种下游任务上的多个 LLMs 中观察到了这一现象。在长上下文推理任务(如 Needle-in-a-Haystack 和 BABILong)中,SWA 实现了显著更高的性能(比线性注意力高出 2 到 10 倍)。SWA 无需后训练,速度极快且内存需求低;因此,它是一种极其廉价且可靠的解决方案。 为了降低推理时的内存成本,我们强烈建议改用 SWA 而不是进行线性模型的后训练。线性注意力模型虽然展现出了一定的潜力,但可能需要进行从头训练或大量的后训练才能勉强达到 SWA 的水平。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力