Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

📄 arXiv: 2608.20999v1 📥 PDF

作者: Haiming Li, Yingsheng Liu, Jingmin Zhu, Siyuan Yan, Xieji Li, Jiajun Sun, Zhen Yu, Zongyuan Ge

分类: cs.CV

发布日期: 2026-08-21

备注: EMNLP 2026 (Main Conference)


💡 一句话要点

提出Ordinal Lens Alignment以解决多模态LLMs的输出对齐问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 有序回归 Ordinal Lens Alignment 推理校正 图像质量评估 年龄估计 疾病分级

📋 核心要点

  1. 现有的多模态大语言模型在处理有序回归任务时,输出的数字标记与内部有序证据之间存在较大差距。
  2. 本文提出了一种新的方法Ordinal Lens Alignment(OLA),通过在推理时校正数字标记logits来改善输出的有序性。
  3. 实验结果表明,OLA在大多数设置中超越了当前最先进的基线,并在每个实验中均表现出显著的提升。

📝 摘要(中文)

多模态大语言模型(MLLMs)将语言模型接口应用于视觉输入,处理诸如年龄估计、图像质量评估和疾病分级等有序回归任务。本文探讨了MLLMs是否能够可靠地将内部有序证据转换为有序的数字标记输出。研究表明,在四个有序基准和四个MLLM骨干网络中,隐藏状态中的有序标签可以通过Spearman相关性线性恢复,相关性高达0.938。然而,原生数字标记输出对这一结构的揭示较弱。为此,本文提出了Ordinal Lens Alignment(OLA),一种在推理时使用的冻结骨干网络方法,通过在中到深解码器层上训练轻量级的W_S锚定透镜,融合成有序分布,并在生成时仅校正数字标记的logits。实验结果显示,OLA在大多数设置中优于SOTA的LoRA调优OrderChain基线,并在每个设置中超越了离线透镜。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在有序回归任务中,输出的数字标记与内部有序证据之间的对齐问题。现有方法在这一点上表现不佳,导致输出的准确性不足。

核心思路:论文提出的核心思路是使用Ordinal Lens Alignment(OLA),通过在推理阶段校正数字标记的logits,来更好地反映模型内部的有序结构。这样的设计旨在提升模型在有序回归任务中的表现。

技术框架:整体架构包括冻结的骨干网络和在中到深解码器层上训练的轻量级透镜。透镜将内部有序证据融合成有序分布,并在生成过程中调整数字标记的logits。

关键创新:最重要的技术创新点在于引入了推理时的透镜校正机制,这与现有方法的训练阶段调整不同,能够在不改变模型参数的情况下提升输出的有序性。

关键设计:在设计中,透镜的锚定方式和轻量级结构是关键,确保了在推理时的高效性和准确性。同时,损失函数的设计也针对有序回归任务进行了优化,以提高模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,OLA在大多数设置中超越了当前最先进的LoRA调优OrderChain基线,且在所有16个模型-数据集组合中,线性探测与原生输出之间的绝对点准确性差距达到16到77,表明了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括医疗影像分析、年龄估计和图像质量评估等需要有序回归的任务。通过提升多模态大语言模型在这些任务中的表现,能够为相关行业提供更准确的决策支持,进而推动智能医疗和自动化评估的发展。

📄 摘要(原文)

Multimodal LLMs apply the language model interface to visual inputs, where ordinal regression tasks such as age estimation, image quality assessment, and disease grading require autoregressive decisions over ordered class labels. We ask whether MLLMs reliably convert internal ordinal evidence into ordered digit-token outputs. Across four ordinal benchmarks and four MLLM backbones, ordinal labels are linearly recoverable from hidden states with Spearman correlation up to 0.938, and a task-designed prompt further sharpens this structure. Yet native digit-token outputs weakly expose it: the unembedding matrix filters the ordinal direction, and the digit-token row space retains below 1.15% across all 16 model-dataset combinations, with a 16 to 77 absolute-point accuracy gap between linear-probe and native outputs. We introduce Ordinal Lens Alignment (OLA), a frozen-backbone inference-time method that trains lightweight W_S-anchored lenses on mid-to-deep decoder layers, fuses them into an ordinal distribution, and corrects only digit-token logits at generation. OLA outperforms the SOTA LoRA-tuned OrderChain baseline in most settings while keeping the MLLM frozen, surpasses discriminative ordinal baselines in most cells, and improves over an offline lens in every setting.