跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

Aphanta:诊断多模态推理中图像编辑中间态的任务对齐框架

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

原文
发到 X

显式的视觉中间产物可以帮助多模态大语言模型(MLLMs)外化空间证据和更新的视觉状态,但其效用取决于图像编辑器能否忠实地实现所需的变换。我们引入了Aphanta,一个针对MLLM -> 图像编辑器 -> MLLM流水线的自动化任务发现和闭环诊断框架。Aphanta评估三个条件——直接推理、使用编辑器生成的中间产物进行推理,以及使用理想化的参考中间产物进行推理——以区分潜在的视觉提升空间与当前编辑器的实际效用。在20个候选任务和多种编辑器-MLLM组合中,我们发现效用强烈依赖于任务条件。增益集中在视觉线索注入、接地和反事实状态实现上,而需要符号敏感构建或结构外推的中间产物则明显不太可靠。在选定的正任务子集上,我们整合的Qwen流水线将平均任务得分从0.343提升到0.445(+10.2分;相对提升29.7%),而完整研究也保留了过滤掉的和未成功的任务以揭示边界。这些结果将图像编辑定位为一种专门的视觉工作空间,而非通用的推理机制,并确立了Aphanta作为衡量任务-表示对齐、编辑器实现和下游流水线效用的可复用协议。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近