WithEveryone:统一群像生成与身份定位框架
WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
群像生成中的多身份精准绑定是行业痛点,这篇论文给出了可复现的 Layout-Grounded ID Loss 等硬核工程方案,效果显著,值得研究者和开发者深入阅读。
当场景必须包含许多指定人物时,保持身份特征的图像生成变得越来越不可靠。除了保留每个身份外,模型还必须将每个参考对象绑定到特定的人物和位置,同时训练时的身份损失必须在多个噪声预测的面部之间建立对应关系。我们提出了 WithEveryone,这是一个统一的框架,用于生成最多包含十个参考身份的群体图像。WithEveryone 将每个选定的身份注入为寻址标记(addressed token),预测结构化的身份-布局计划,并将该计划渲染为视觉条件。其核心目标是基于布局的身份损失(Layout-Grounded ID Loss),它利用标注的面部区域直接监督预期的身份,避免了不稳定的基于嵌入的面部匹配;此外,还引入了身份表示强制(ID Representation Forcing)机制,在图像合成之前对每个身份进行预测训练。在一个身份不相交的基准测试中,WithEveryone 实现了最高的目标上下文身份相似度,将面部相似度从 GPT-Image-2 的 0.462 提升至 0.499,同时将复制粘贴伪影从 0.169 降低至 0.055。它还覆盖了 97.3% 的请求身份,重复率仅为 2.8%。这些结果表明,显式的身份-布局接地(grounding)使得保持身份特征的生成能够扩展到更大的群体,而无需依赖直接的面部参考复制。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力