精选86Hugging Face 每日论文(json_list)技巧与观点
Naver提出VAT:验证感知训练优化投机解码加速推理
Verification-Aware Training for Speculative Decoding
推荐理由
投机解码是提升大模型推理速度的关键工程手段,VAT提供了可复现的训练优化方案,能直接落地提升部署效率,值得做推理优化的同学参考。
推测解码通过使用草稿模型生成候选 token,并由目标模型在一次前向传播中进行验证,从而加速大语言模型的推理。验证过程是顺序进行的,并从第一个拒绝位置开始丢弃后续所有位置;然而,现有的草稿训练依赖于对目标模型的 token 级模仿,并采用固定的逐位置权重,这种权重既未反映上述特性。我们引入了感知验证的训练(Verification-Aware Training, VAT),这是一个插件式框架,它在每个训练步骤中模拟验证过程,并将由此产生的接受与拒绝模式转化为监督信号。VAT 包含两个组件:(i) 一个验证头,这是一个轻量级的联合训练二元分类器,用于监督草稿模型判断每个位置是否通过了顺序验证;(ii) 验证自适应加权,它通过在每个样本的第一个拒绝点之前保持完整权重,并将衰减重新锚定到该点开始,从而取代了固定的权重调度方案。VAT 仅修改训练目标,因此可以叠加在现有方法之上,而无需更改草稿架构、目标模型或推理流程。应用于 Qwen3-4B、Qwen3-8B 和 LLaMA-3.1-8B 上的 EAGLE-3 和 DFlash,VAT 使平均接受长度提高了高达 11.4%,实际运行加速比提高了高达 8.7%,且在数学、代码和对话基准测试中均获得了一致的提升。代码将在 https://github.com/naver-ai/vat 提供。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力