From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

📄 arXiv: 2608.26856v1 📥 PDF

作者: Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

分类: cs.CV, cs.AI

发布日期: 2026-08-27

备注: accepted by ECCV 2026


💡 一句话要点

提出MedREAL以解决医学图像分析中的像素级定位问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医学图像分析 多模态学习 视觉问答 分割技术 推理机制

📋 核心要点

  1. 现有的多模态大型语言模型在医学视觉问答中缺乏精确的像素级定位,影响了临床应用的可信度。
  2. 本文提出MedREAL框架,通过引入SARP和R2V机制,将语言推理与空间定位有效结合。
  3. 实验结果显示,MedREAL在基准测试中取得68.49%的gIoU和70.47%的cIoU,显著优于现有方法。

📝 摘要(中文)

尽管多模态大型语言模型(MLLMs)在医学视觉问答(Med-VQA)中表现出色,但其对全局图像特征的依赖往往缺乏精确的像素级定位,限制了临床可信度。为了解决这一问题,本文提出了MedREAL(医学推理驱动的回答与定位),一个统一框架,能够无缝对齐语言推理与空间定位。MedREAL引入了基于分割的推理池化(SARP),直接从MLLM的隐藏状态中提取任务相关的语义证据。此外,提出了推理到视觉(R2V)融合机制,将这些推理感知特征有效注入分割管道,以实现准确的掩膜解码。通过构建MedRAVS-13K数据集,进行广泛实验,结果表明MedREAL在基准评估中显著超越现有技术,提供了一个稳健且可解释的医学图像分析框架。

🔬 方法详解

问题定义:本文旨在解决医学图像分析中多模态大型语言模型在像素级定位上的不足,现有方法往往依赖全局特征,缺乏精确的空间信息。

核心思路:MedREAL框架通过引入基于分割的推理池化(SARP)和推理到视觉(R2V)机制,旨在将语言推理与图像的空间信息有效结合,从而实现更高的定位精度。

技术框架:MedREAL的整体架构包括两个主要模块:SARP模块用于从MLLM的隐藏状态中提取语义证据,R2V模块则将这些证据注入到分割管道中,实现准确的掩膜解码。

关键创新:最重要的创新在于SARP的引入,它能够直接从分割标记中提取与任务相关的语义信息,显著提高了模型的推理能力和定位精度。

关键设计:在模型设计中,采用了特定的损失函数来优化分割效果,并在网络结构中引入了多层次的特征融合,以增强模型对不同图像模态的适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在广泛的实验中,MedREAL在医学视觉问答和分割任务中表现优异,取得了68.49%的gIoU和70.47%的cIoU,显著超越了当前的最先进技术,展示了其在医学图像分析中的强大能力和潜力。

🎯 应用场景

该研究的潜在应用领域包括医学影像分析、临床辅助诊断和医疗决策支持。通过提供更高的定位精度和可解释性,MedREAL能够帮助医生更好地理解和分析医学图像,从而提高诊断的准确性和效率。未来,该框架有望扩展到其他领域的多模态学习任务。

📄 摘要(原文)

Although Multimodal Large Language Models (MLLMs) have demonstrated impressive performance in Medical Visual Question Answering (Med-VQA), their reliance on global image features often lacks precise pixel-level grounding, thereby limiting clinical trustworthiness. To bridge the semantic gap between high-level clinical reasoning and spatial localization, we propose \textsc{\textsc{MedREAL}} (\textbf{Med}ical \textbf{RE}asoning-driven \textbf{A}nswering and \textbf{L}ocalization), a unified framework that seamlessly aligns linguistic reasoning with spatial grounding. Specifically, \textsc{MedREAL} introduces \textbf{S}eg \textbf{A}nchored \textbf{R}easoning \textbf{P}ooling (SARP) to distill task-relevant semantic evidence directly from \texttt{[SEG]} tokens within the MLLM's hidden states. Furthermore, a \textbf{R}easoning-to-\textbf{V}isual (R2V) fusion mechanism is proposed to effectively inject these reasoning-aware features into a segmentation pipeline for accurate mask decoding. To facilitate this paradigm, we construct MedRAVS-13K, a comprehensive dataset comprising 13,824 expertly validated samples across four diverse imaging modalities. Extensive experiments demonstrate that \textsc{MedREAL} significantly outperforms state-of-the-arts, achieving 68.49\% gIoU and 70.47\% cIoU on benchmark evaluations. By generating evidence masks that are strictly consistent with textual diagnoses, \textsc{MedREAL} provides a robust, interpretable framework for reasoning-driven medical image analysis.