跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

Pixel Linguist II:原生分辨率视觉文本表示学习新SOTA

On the Design Fundamentals of Pixel Text Representation Learning

原文
发到 X
推荐理由

深入剖析了视觉文本表示学习的底层设计原则,提出的四要素具有极高的方法论参考价值,适合从事文档理解与多模态表征的研究者阅读。

富含文本的视觉输入需要能够直接在像素空间中读取、检索和压缩语言的模型,然而现有的像素-文本编码器在固定分辨率预训练、视觉捷径学习、弱视觉定位和多语言视觉文本理解方面存在困难。在本研究中,我们探讨了稳健的视觉文本表示学习所需的基本设计原则。通过系统的控制消融实验,我们确定了四个关键组件:可变图像分辨率和渲染字体大小提供了用于高分辨率文档泛化的空间代理;自然图像-文本对对于定位不可或缺,并防止仅基于文本的崩溃;布局感知渲染有助于防止像素级捷径;两阶段多语言课程学习实现了有效的跨语言对齐。通过将上述原则整合到可扩展的训练方案中,我们训练了 Pixel Linguist II,这是一个原生分辨率视觉编码器,采用即时渲染、统一对比定位以及涵盖 2.8 亿个训练样本的多语言课程进行训练。Pixel Linguist II 在英语、跨语言和多语言 Visual STS 和 ViDoRe 基准上取得了新的最先进结果,同时也提升了多模态大语言模型(MLLM)的下游评估效果。值得注意的是,Pixel Linguist II 在 80% 视觉令牌压缩下仍保持鲁棒性,显示出在光学上下文压缩方面的巨大潜力。我们的代码和资源可在 https://github.com/Pixel-Linguist/Pixel-Linguist-II 获取。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近