跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

TRACE-Bench:多参考图像生成的分解与诊断基准

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

原文
发到 X

尽管在多参考图像生成的统一多模态模型方面取得了近期进展,现有基准仍然围绕预定义任务类型(例如“主体组合”)组织,这限制了它们评估组合泛化的能力。为解决这一差距,我们提出一个新视角:不进行特定任务的评估,而是将多参考生成分解为原子且可组合的操作。通过对现有任务的系统分析,我们识别出一小组核心能力:主体提取、多主体组合、属性绑定和场景组合。然而,这些能力并非独立;它们层级交互,且其复杂度因任务而异。为捕捉这一结构,我们引入多参考生成的组合式表述。认识到多样化的多参考任务共享一组共同的原子操作,我们采用面向能力的视角,并形式化四个算子:Anchor (f)、Disentangle (g)、Apply (⊕) 和 Compose (C)。任何多参考提示随后可表示为这些算子上的组合公式,其结构复杂度通过算子槽位的数量来量化。基于这一表述,我们构建了 TRACE-Bench,包含约 1,600 个评估案例,覆盖槽位数量 1--8,由 631 个公式模板和约 4,000 张参考图像构建,涵盖多样艺术风格和真实世界主体。公式结构直接驱动面向算子的评估协议,用于逐能力评分,以及用于递归故障定位的诊断树分析。评估 9 个领先模型揭示了整体评分无法看到的见解:主要瓶颈在于解纠缠 (g) 和属性绑定 (⊕),而非场景级组合 (C),即使最佳模型在属性保真度上也仅得 0.74 分。项目页面:https://amuseum-whr.github.io/TraceBench

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近