Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
作者: Jiani Guo, Junjie Wang, Jie Wu, Pengxiang Zhao, Dongdong Zhang, Shaohan Huang, Yujiu Yang, Furu Wei
分类: cs.LG, cs.CL
发布日期: 2026-08-31
💡 一句话要点
提出信用可寻址推理以解决多模态几何推理问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态几何推理 信用可寻址推理 视觉语言模型 推理透明性 结构先验
📋 核心要点
- 现有方法在多模态几何推理中难以清晰地展示决策过程,导致推理不够透明和有效。
- 本文提出信用可寻址推理,通过在推理过程中定义语义单元来改进学习和信用分配,增强推理的可解释性。
- CE-GRPO在九个几何基准测试中表现优异,平均准确率达到76.04,显著超越了现有的基线模型。
📝 摘要(中文)
多模态几何推理要求视觉语言模型(VLMs)提取精确的视觉关系并通过多步推理加以保留。现有的自由形式轨迹模糊了决定答案的决策,而轨迹级强化学习则将单一的终端信号分配到整个响应中。本文提出了信用可寻址推理,其中推理过程中暴露的语义单元定义了学习比较替代方案和分配信用的地方。我们通过Code-CoT和CE-GRPO实现了这一原则,前者保留了图示,将视觉关系表示为可执行代码,后者使用结构先验和类型归一化熵选择事件边界,从共享前缀中采样完整的延续,并将结果差异转化为局部优势。在九个几何基准测试中,CE-GRPO的平均准确率达到76.04,分别比Qwen3-VL-8B和轨迹级GRPO提高了8.09和3.43个百分点。
🔬 方法详解
问题定义:本文旨在解决多模态几何推理中现有方法的透明性不足和推理效率低下的问题,尤其是如何清晰展示决策过程和分配学习信用。
核心思路:提出信用可寻址推理的核心思想是利用推理过程中暴露的语义单元来定义学习比较的依据,从而提高推理的可解释性和准确性。
技术框架:整体架构包括Code-CoT和CE-GRPO两个主要模块。Code-CoT保留图示并将视觉关系表示为可执行代码,而CE-GRPO则通过结构先验选择事件边界,优化推理过程。
关键创新:最重要的技术创新在于信用可寻址推理的引入,使得推理过程中的每一步都能明确地与学习结果相联系,区别于传统的轨迹级强化学习方法。
关键设计:在CE-GRPO中,采用结构先验和类型归一化熵来选择事件边界,并通过共享前缀采样完整的推理延续,设计了新的损失函数以优化结果差异的局部优势。
🖼️ 关键图片
📊 实验亮点
在九个几何基准测试中,CE-GRPO的平均准确率达到76.04,显著超越了Qwen3-VL-8B和轨迹级GRPO,分别提高了8.09和3.43个百分点,展示了其在长依赖多模态推理中的优势。
🎯 应用场景
该研究的潜在应用领域包括教育、机器人导航和自动化设计等,能够帮助系统更好地理解和推理复杂的几何关系,提升决策的准确性和透明度。未来,随着技术的进步,可能会在更多多模态任务中得到应用,推动智能系统的发展。
📄 摘要(原文)
Multimodal geometry reasoning requires VLMs to extract precise visual relations and preserve them through multi-step deduction. Existing free-form traces obscure the decisions that determine the answer, and trajectory-level reinforcement learning distributes a single terminal signal across the entire response. We introduce credit-addressable reasoning, in which the semantic units exposed during inference also define where learning compares alternatives and assigns credit. We instantiate this principle with Code-CoT, which retains the diagram, represents visual relations as line-addressable executable code, and organizes reasoning into typed events, and CE-GRPO, which selects event boundaries using structural priors and type-normalized entropy, samples complete continuations from shared prefixes, and converts outcome differences into localized advantages. Across nine geometry benchmarks, CE-GRPO achieves an average accuracy of 76.04, outperforming Qwen3-VL-8B and trajectory-level GRPO by $8.09$ and 3.43 points, respectively. Its relative advantage increases with the number of intermediate events, demonstrating the value of representation--optimization co-design for long, dependency-heavy multimodal reasoning.