Dynamic Resolution Routing for Efficient Egocentric Grounding

📄 arXiv: 2608.01638v1 📥 PDF

作者: Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

分类: cs.CV

发布日期: 2026-08-03


💡 一句话要点

提出SmartRes框架以解决自我中心视觉定位中的高分辨率输入问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自我中心视觉定位 动态分辨率路由 多模态大语言模型 视觉标记处理 边际正则化 高分辨率补丁 物体中心选择 效率优化

📋 核心要点

  1. 现有方法在自我中心视觉定位中面临高分辨率输入的处理成本过高的问题,导致小物体定位效果不佳。
  2. 论文提出的SmartRes框架通过动态分辨率路由,在像素空间中优化效率,能够有效选择物体中心区域的高分辨率信息。
  3. 实验结果显示,SmartRes在减少视觉标记的同时,保持了高达86.4%的性能,并且推理速度比现有方法快1.66倍。

📝 摘要(中文)

自我中心视觉定位需要高分辨率输入以定位小物体。然而,现有的多模态大语言模型在这一领域的扩展受到视觉标记处理成本过高的限制。我们发现基于标记减少的高效策略在选择物体中心空间证据时不够可靠。为此,我们提出了SmartRes框架,通过动态分辨率路由在像素空间中进行效率优化。SmartRes首先对全局上下文进行低分辨率编码,然后使用轻量级路由器激活物体中心区域的高分辨率补丁,并构建顺序保留的视觉序列。为了在严重的前景-背景不平衡下实现稳健的路由,我们引入了边际正则化路由目标,以增加前景-背景的logit分离并提高前景召回率。实验结果表明,SmartRes在Ego4D和EgoIntention数据集上将视觉标记减少了67%,同时保留了86.4%的全分辨率性能,并且推理速度比最先进的标记减少方法快1.66倍,且准确性更高。

🔬 方法详解

问题定义:本论文旨在解决自我中心视觉定位中高分辨率输入处理成本过高的问题。现有方法在标记减少方面的策略不够可靠,无法有效选择物体中心的空间证据。

核心思路:论文提出的SmartRes框架通过动态分辨率路由,在像素空间中进行效率优化。该方法首先对全局上下文进行低分辨率编码,然后激活物体中心区域的高分辨率补丁,从而构建顺序保留的视觉序列。

技术框架:SmartRes的整体架构包括两个主要模块:低分辨率全局上下文编码模块和高分辨率补丁激活模块。低分辨率编码用于捕捉全局信息,而轻量级路由器则负责选择并激活高分辨率区域。

关键创新:SmartRes的核心创新在于引入了边际正则化路由目标,增强了前景与背景之间的logit分离,从而提高了前景的召回率。这一设计与现有方法相比,显著提升了物体中心区域的选择能力。

关键设计:在关键设计方面,论文详细描述了边际正则化损失函数的构建,以及轻量级路由器的网络结构,确保了在保持高效性的同时,能够有效处理前景-背景不平衡的问题。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SmartRes在Ego4D和EgoIntention数据集上将视觉标记减少了67%,同时保留了86.4%的全分辨率性能。此外,SmartRes的推理速度比最先进的标记减少方法快1.66倍,且在小物体定位上表现出色,显示出其在自我中心应用中的有效性。

🎯 应用场景

该研究在自我中心视觉定位领域具有广泛的应用潜力,尤其是在机器人视觉、增强现实和视频监控等场景中。通过提高小物体的定位精度,SmartRes能够为相关应用提供更高的智能化水平和用户体验,未来可能推动更多基于视觉的智能系统的发展。

📄 摘要(原文)

Egocentric visual grounding requires high-resolution inputs to localize small objects. However, scaling Multimodal Large Language Models to this domain is constrained by the excessive cost of visual token processing. We identify that current efficient strategies based on token reduction are unreliable for selecting object-centric spatial evidence. To overcome this, we propose SmartRes, a framework that performs efficiency optimization in the pixel space via dynamic resolution routing. SmartRes first encodes a low-resolution view for global context and uses a lightweight router to activate high-resolution patches in object-centric regions and constructs an order-preserving visual sequence. To further enable robust routing under severe foreground-background imbalance, we introduce a margin-regularized routing objective that increases foreground-background logit separation and improves foreground recall. Experiments on Ego4D and EgoIntention show that SmartRes reduces visual tokens by up to 67% while retaining 86.4% of full-resolution performance, and achieves up to 1.66X faster inference than state-of-the-art token reduction methods with higher accuracy. Furthermore, strong performance on small object grounding indicates the effectiveness of SmartRes towards egocentric applications. Code will be publicly available.