Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions
作者: Mohammad Arif Ul Alam
分类: cs.CV, cs.AI
发布日期: 2026-08-20
💡 一句话要点
提出跨模态基础模型以提升水下机器人在恶劣视觉条件下的感知能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 水下机器人 多模态融合 视觉退化 声纳感知 基础模型 鲁棒性 自适应门控 性能提升
📋 核心要点
- 现有水下机器人感知方法在恶劣视觉条件下表现不佳,光学图像的退化严重影响了检测性能。
- 本文提出了一种基于冻结DINOv2视觉编码器的跨模态融合方法,能够在视觉退化时有效利用声纳信息。
- 实验结果表明,退化感知的视觉-声纳融合在极端条件下的准确率提升至0.6152,显示出显著的性能改进。
📝 摘要(中文)
可靠的水下机器人感知仍然面临挑战,因为光学图像在浑浊、波长依赖衰减、低照明、散射和模糊等条件下会退化。尽管声纳提供了不易受光学可见性影响的补充信息,但以往的视觉-声纳研究主要集中在特征对齐和名义检测性能上。本文探讨了在视觉可靠性下降时的跨模态鲁棒性,并评估了预训练视觉基础模型表示在严重退化情况下是否可以通过声纳进行补充。我们使用冻结的DINOv2作为视觉编码器,并构建了一个从清晰到极端视觉条件的五级基准。通过比较传统视觉检测、冻结的基础模型表示、声纳上下文、固定多模态融合、清晰训练的自适应门控和退化感知门控融合,提出了一种在全退化范围内训练融合机制的方法,同时保持视觉和声纳编码器冻结,从而使模态贡献能够自适应而无需微调预训练的主干。在极端退化下,DINOv2基线的平衡准确率为0.4610,而退化感知的视觉-声纳融合达到了0.6152,提升了33.5%。
🔬 方法详解
问题定义:本文旨在解决水下机器人在恶劣视觉条件下的感知问题,现有方法在光学图像退化时表现不佳,无法充分利用声纳信息。
核心思路:通过冻结视觉和声纳编码器,提出一种在不同退化条件下自适应调整模态贡献的融合机制,以提高感知的鲁棒性。
技术框架:整体架构包括视觉编码器(DINOv2)、声纳编码器、以及自适应融合模块。通过构建五级视觉退化基准,评估不同融合策略的性能。
关键创新:提出的退化感知门控融合方法能够在不微调预训练模型的情况下,动态调整视觉和声纳信息的贡献,显著提升了感知性能。
关键设计:在实验中,采用了固定的损失函数和网络结构,确保了在不同退化条件下的稳定性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在极端退化条件下,DINOv2基线的平衡准确率为0.4610,而退化感知的视觉-声纳融合达到了0.6152,提升幅度达到33.5%。声纳的贡献在清晰条件下为14.2%,在极端退化下提升至41.3%,表明了跨模态依赖的自适应重分配。
🎯 应用场景
该研究具有广泛的应用潜力,特别是在水下探测、海洋监测和水下机器人导航等领域。通过提升水下机器人在复杂环境下的感知能力,能够显著提高其在实际任务中的表现和安全性,未来可能推动相关技术的商业化和普及。
📄 摘要(原文)
Reliable underwater robotic perception remains difficult because optical imagery degrades under turbidity, wavelength-dependent attenuation, low illumination, scattering, and blur. Although sonar provides complementary information that is less affected by optical visibility, prior visual-sonar research has largely focused on feature alignment and nominal detection performance. We investigate cross-modal robustness as visual reliability deteriorates and assess whether pretrained visual foundation-model representations can be complemented by sonar under severe degradation. We use frozen DINOv2 as the visual encoder and construct a controlled five-level benchmark ranging from clean to extreme visual conditions. We compare conventional visual detection, frozen foundation-model representations, sonar context, fixed multimodal fusion, clean-trained adaptive gating, and degradation-aware gated fusion. Our method trains the fusion mechanism across the full range of degradation while keeping the visual and sonar encoders frozen, allowing modality contributions to adapt without fine-tuning the pretrained backbone. Under extreme combined degradation, the DINOv2 baseline achieves 0.4610 balanced accuracy, while degradation-aware visual-sonar fusion reaches 0.6152, a 33.5% relative improvement. The learned sonar contribution increases from 14.2% under clean conditions to 41.3% under extreme degradation, demonstrating adaptive redistribution of cross-modal reliance. Fusion provides the largest gains under severe turbidity and blur, whereas color attenuation alone yields little additional benefit. These results show that foundation-model representations remain valuable but insufficient under severe information loss, and that explicitly adapting fusion to modality reliability can improve robust underwater multimodal perception.