跳到主内容
@wquguru
精选72Hugging Face 每日论文(json_list)论文研究

EviRank:基于结构化证据的多模态图像重排序方法

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

原文
发到 X

现实世界中的图像搜索查询是多模态且组合式的:例如“找到这件粉色的衬衫”指定了需要保留的实体、需要修改的属性以及需要忽略的上下文。然而,现有的重排序器要么将这种多维度的相关性压缩为不透明的嵌入表示,要么依赖自由形式的思维链,这容易遗漏或幻觉出细粒度的约束条件。借鉴自然语言处理中基于评分标准和检查表的评估方法,我们将多模态图像重排序重新定义为语义约束满足问题,并提出了 EviRank。EviRank 能将任何查询——纯文本、纯图像或组合式——解析为一个统一的证据包:包含六个语义槽位(如实体、属性、关系)上的类型化标准,每个标准都被标记为必需、禁止或可忽略。随后,重排序简化为基于证据的条件验证,在一个无需训练的单一过程中结合了确定性的评分标准打分和基于证据的列表式比较。这些显式的证据还可以作为结构化监督信号,用于可选地蒸馏出一个轻量级的学生模型。在涵盖文到图、图到图以及组合式图像检索的五个基准测试中,EviRank 实现了最先进的性能,而蒸馏后的学生模型以显著更低的成本保留了教师模型超过 90% 的能力。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近