Declarative Attention:让大模型自主声明注意力区域以加速长
Language Models Can Control Their Own Attention
这篇论文提出的 Declarative Attention 机制非常巧妙,通过让模型“自报家门”来跳过无效的 KV Cache 读取,在不重新训练的情况下显著降低了长文本推理的计算成本,对优化 Agent 长对话场景极具参考价值。
语言模型在注意力机制上花费大部分计算于上下文的一小部分,但它们却需要读取整个 KV 缓存以找到那些关键的 token。如果用户在 100 万 token 的对话中询问之前的某个细节,全局注意力层必须扫描完整的上下文才能生成回复中的每个 token。一种显著的方法是通过轻量级代理分数预先选择相关 token 来缓解这一成本,但这种外在评分方法每步仍会产生 O(N) 的计算开销。我们采取了一种内在方法,其动机源于一个简单的疑问:模型难道不会已经知道上下文中哪些部分是相关的吗?为此,我们引入了声明式注意力(Declarative Attention, DA),这是一种促使模型在其思维链中声明其需要关注位置的协议,将生成分为三种模式:(完整上下文)、(特定区域)和(仅最近输出)。推理引擎像解析工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评估中,DA 在现成模型(Gemma-4-31B、Qwen-3.6-27B)上显著减少了解码期间的总注意力 token 数量(分别为 52.0% 和 31.1%),同时精度仅有轻微下降(分别为 1.27pp 和 2.75pp),且这种下降随模型规模增大而缩小。DA 解锁了稀疏注意力的一个新维度,未来工作可以通过基于训练的方法进一步挖掘其潜力。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力