SimLoss:单次推理细粒度图像描述方法
A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
推荐理由
用单次推理替代多阶段流程,速度提升 20 倍且精度不降,为细粒度视觉语言任务提供了极具参考价值的高效范式。
一张图片可能胜过千言万语,但大多数图像描述模型仅用寥寥数语进行描述。现代视觉-语言模型能够生成流畅的高层级描述,却常常遗漏使图像在视觉上具有特定性的属性、数量、纹理、材质和空间关系。最近的多阶段系统通过生成、分解、验证和重写来恢复部分这些细节,但以显著增加推理延迟为代价。 我们提出了 SimLoss,这是一种用于单次传递细粒度图像描述的无参考嵌入空间目标函数。SimLoss 训练一个视觉-语言模型,使其投影的隐藏状态表示与冻结的图像嵌入通过对比损失(InfoNCE)对齐,在任何文本解码之前提供密集的视觉监督信号,且既不需要人工编写的细粒度描述,也不需要来自多阶段流程的伪描述。我们将其实例化为 SimLoss FFT,它通过本地可用的嵌入模型进行反向传播,以及 SimLoss GRPO,它将那个模型视为黑盒奖励。 与单次传递、多阶段验证、奖励优化和感知感知的基线相比,完全可微分的微调变体 SimLoss FFT 实现了最高的精确率,同时几乎匹配了多阶段方法的 F1 分数,同时保留了单次传递推理,并且运行速度比多阶段流程快大约 20 倍。 基于奖励的变体 SimLoss GRPO 获得了最强的召回率。总之,这些结果表明,嵌入空间的监督可以在单次传递描述器的延迟下恢复多阶段验证的质量。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力