Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures

📄 arXiv: 2609.00663v1 📥 PDF

作者: Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

分类: cs.CV, cond-mat.mtrl-sci, physics.chem-ph, quant-ph

发布日期: 2026-09-01


💡 一句话要点

提出无模型渲染上限以解决视觉语言模型的感知与推理分离问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 多模态评估 渲染上限 模型性能提升 计算机视觉

📋 核心要点

  1. 现有的视觉语言模型无法有效区分图像的误读与推理错误,导致评估结果不准确。
  2. 论文提出了渲染上限的概念,通过无模型的方式来建立基准,避免了引入额外模型的复杂性。
  3. 实验结果显示,提供精确几何信息的文本显著提升了模型性能,且一个无语言组件的视觉模型表现优于所有视觉语言模型。

📝 摘要(中文)

多模态评估无法判断视觉语言模型是误读图像还是推理错误,因为现有方法都在循环中引入了第二个模型。我们提出了渲染上限,这是一种无模型的基准参考,通过渲染已知物体来构建:反转固定摄像机并重新解决跨视图对应关系,准确恢复图像所支持的答案。我们证明渲染上限仅在可枚举的投影重合集上失败,并在2160个渲染的晶体结构上验证该集合为空,因此模型的每个缺陷都归因于模型本身。在十四个视觉语言模型中,提供精确几何信息的文本提升了每个模型的表现,但对于十三个模型仅缩小了一半的差距,而一个没有语言组件的监督视觉模型在相同图像上的得分为0.8952,超过了所有视觉语言模型。该工具揭示了提取阶段的伪造,误归因于推理的下游准确性,提供了基准构建者的摄像机放置规则,并可转移到任何具有可逆前向渲染的基准上。

🔬 方法详解

问题定义:论文要解决的问题是如何有效区分视觉语言模型在图像处理中的误读和推理错误。现有方法通过引入第二个模型来实现这一目标,但这增加了复杂性并可能导致误判。

核心思路:论文的核心思路是引入渲染上限作为无模型的基准,通过渲染已知物体并反转摄像机位置来准确恢复图像支持的答案,从而避免了对额外模型的依赖。

技术框架:整体架构包括渲染已知物体、反转摄像机位置、解决跨视图对应关系等主要模块。通过这些步骤,能够生成准确的基准答案并与模型输出进行对比。

关键创新:最重要的技术创新点在于提出了渲染上限的概念,提供了一种无模型的评估方式,与现有方法的本质区别在于不再依赖于额外的推理模型。

关键设计:在实验中,采用了2160个渲染的晶体结构进行验证,确保了渲染上限的有效性。同时,设计了摄像机放置规则,以指导基准构建者进行更准确的评估。实验中还使用了特定的损失函数来优化模型性能。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,提供精确几何信息的文本能够显著提升模型性能,尽管对于十三个模型仅缩小了一半的差距,但一个无语言组件的监督视觉模型在相同图像上的得分为0.8952,超越了所有视觉语言模型,展示了该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、机器人、自动驾驶等需要视觉理解与语言推理结合的场景。通过提供更准确的模型评估方法,能够提升多模态系统的性能,促进相关技术的实际应用与发展。

📄 摘要(原文)

Multimodal evaluations cannot say whether a vision-language model misread an image or misreasoned about it, because every existing method for separating the two places a second model in the loop. We introduce the render ceiling, a model-free reference for benchmarks built by rendering known objects: inverting the frozen cameras and re-solving cross-view correspondence recovers exactly the answer the images support. We prove the ceiling fails only through an enumerable set of projection coincidences and certify that set empty on 2,160 rendered crystal structures, so every point of a model's deficit belongs to the model. Across fourteen vision-language models, supplying exact geometry as text lifts every model yet closes under half the gap for thirteen, while a supervised vision model with no language component reads the same images at 0.8952, above every vision-language model. The instrument exposes extraction-stage fabrication that downstream accuracy would misattribute to reasoning, yields camera-placement rules for benchmark builders, and transfers to any benchmark with an invertible forward rendering.