跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

Autoregressive Mosaics:探究纯文本大模型的2D空间推理能力

Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models

原文
发到 X

仅使用文本和代码训练的庞大语言模型(LLMs)有时能生成可识别图像的程式。然而,尚不清楚这是否反映了其对二维空间布局的内部表征,抑或仅仅是将空间描述转化为代码的能力。我们引入了自回归马赛克基准测试(AM-Bench),该基准测试将这些因素分离开来:首先,翻译任务向模型提供以文字形式完全指定的图片几何结构作为提示,并要求生成能够产生该图片的代码。其次,布局任务要求模型根据未充分指定的提示来组合图像。在八个仅含文本和代码的开源权重模型中,所有模型都能可靠地将指定几何结构转化为代码,但它们在开放式布局方面的表现存在显著差异,表明这些差异不能仅由代码生成能力来解释。对输出介质的消融实验进一步表明,模型使用的表达界面或介质至关重要:用原始 SVG 替换过程性代码可提高所有模型的布局得分。最后,对模型激活状态的探测显示,在生成之前就已存在粗略的布局计划,但该计划仅反映提示所隐含的布局。在生成过程中,模型追踪的是不断变化的几何状态,而非执行最初固定的计划。总体而言,这些结果表明,纯文本大型语言模型中的二维空间性能取决于模型本身以及输出介质,而不能仅由代码生成能力来解释。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近