DRAgent: Discriminative Reasoning Agent for Referring Expression Segmentation

📄 arXiv: 2608.22885v1 📥 PDF

作者: Yujie Qi, Luyan Zhang

分类: cs.CV

发布日期: 2026-08-24

备注: 5 pages, 3 figures, 4 tables


💡 一句话要点

提出DRAgent以解决语言表达指称分割中的定位偏差问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 指称表达分割 多模态大语言模型 视觉定位 区分推理 像素级掩码 智能监控 自动驾驶

📋 核心要点

  1. 现有方法在视觉定位中依赖一次性坐标预测,容易导致定位偏差和对齐错误。
  2. DRAgent通过构建检测器生成的候选空间,利用MLLM进行目标选择,采用两阶段推理机制提高准确性。
  3. 实验结果显示,DRAgent在多个数据集上取得了竞争力的性能,验证了其有效性。

📝 摘要(中文)

指称表达分割(RES)旨在为语言表达指定的对象生成像素级掩码。现有基于多模态大语言模型(MLLM)的方法通常依赖一次性坐标预测进行视觉定位,这可能导致定位偏差和对齐错误。为了解决这些问题,本文提出了DRAgent,一个基于MLLM的区分推理框架。DRAgent首先构建一个检测器生成的候选空间,然后利用MLLM作为视觉-语义目标鉴别器,通过两阶段的推理机制进行可靠的目标选择。最后,选定的目标框作为空间提示用于基础分割模型生成最终的像素级掩码。实验表明,DRAgent在RefCOCO、RefCOCO+和RefCOCOg数据集上表现出色。

🔬 方法详解

问题定义:论文要解决的问题是指称表达分割中的定位偏差和对齐错误,现有方法依赖一次性坐标预测,导致效果不佳。

核心思路:DRAgent的核心思路是构建一个候选空间,并利用MLLM作为视觉-语义目标鉴别器,通过两阶段的推理机制进行目标选择,从而提高分割的准确性。

技术框架:DRAgent的整体架构包括候选空间构建、MLLM目标选择和基础分割模型三个主要模块。首先生成候选框,然后通过MLLM进行高召回候选筛选和实例验证,最后生成像素级掩码。

关键创新:DRAgent的关键创新在于其两阶段的推理机制,能够有效筛选潜在干扰物并进行实例验证,这与现有方法的单一坐标预测方式有本质区别。

关键设计:在设计上,DRAgent采用了自一致性过滤的推理链数据管道,并结合LoRA进行微调,以增强MLLM的区分推理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DRAgent在RefCOCO、RefCOCO+和RefCOCOg数据集上表现出色,取得了竞争力的性能,具体提升幅度未知,显示出其在指称表达分割任务中的有效性和可靠性。

🎯 应用场景

该研究的潜在应用领域包括智能监控、自动驾驶、机器人视觉等,能够在复杂环境中实现更准确的对象识别和分割。通过提高指称表达分割的准确性,DRAgent有望在自然语言处理与计算机视觉的结合中发挥重要作用,推动相关技术的发展。

📄 摘要(原文)

Referring Expression Segmentation (RES) aims to generate a pixel-level mask for the object specified by a language expression. Recent methods based on multimodal large language models (MLLMs) often rely on one-pass coordinate prediction for visual localization, which serializes continuous spatial locations as discrete text tokens and may lead to localization bias and alignment errors. To address these issues, we propose DRAgent, an MLLM-driven discriminative reasoning (DR) framework for RES. Instead of requiring the MLLM to generate localization coordinates, DRAgent first constructs a detector-generated candidate space and then uses the MLLM as a visual-semantic target discriminator. Specifically, the MLLM performs reliable target selection among potential distractors through a two-stage DR mechanism, which first screens high-recall candidates and then performs instance-wise verification. The selected target box is subsequently used as a spatial prompt for a foundation segmentation model to produce the final pixel-level mask. Furthermore, we construct a self-consistency-filtered reasoning-chain data pipeline for LoRA-based fine-tuning, providing more reliable supervision for enhancing the MLLM's discriminative reasoning capability. Experiments demonstrate that DRAgent achieves competitive performance on RefCOCO, RefCOCO+, and RefCOCOg.