跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

CE-GRPO:基于信用可寻址推理的多模态几何解题方法

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

原文
发到 X
推荐理由

提出了具体的信用分配机制与代码化推理框架,在多模态几何任务上显著超越基线,对提升 VLM 复杂推理能力有参考价值。

多模态几何推理要求视觉语言模型(VLMs)提取精确的视觉关系,并通过多步演绎保留这些关系。现有的自由形式轨迹模糊了决定答案的关键决策,而轨迹级强化学习将单一的终端信号分配给整个响应过程。我们引入了可归因推理(credit-addressable reasoning),在推理过程中暴露的语义单元不仅用于展示信息,还定义了学习机制在哪里比较备选方案并分配信用值。我们通过 Code-CoT 实例化了这一原则,该方法保留图表、将视觉关系表示为可按行寻址的可执行代码,并将推理组织为类型化事件;同时提出 CE-GRPO,利用结构先验和类型归一化熵选择事件边界,从共享前缀采样完整续写内容,并将结果差异转化为局部优势。在九个几何基准测试中,CE-GRPO 取得了 76.04 的平均准确率,分别比 Qwen3-VL-8B 和轨迹级 GRPO 高出 8.09 分和 3.43 分。其相对优势随中间事件数量的增加而扩大,证明了表示与优化协同设计在长链条、高依赖性的多模态推理中的价值。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近