GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures
作者: Yanran Xu, Chuanhang Qiu, Yue Wang, Wenbo Wu, Zhaoxing Li
分类: cs.RO, cs.CV
发布日期: 2026-08-31
🔗 代码/项目: GITHUB
💡 一句话要点
提出Geo-Anchored Fine-Tuning以解决稀有故障的危险识别问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 稀有故障识别 几何先验 视觉模型微调 自动驾驶 机器学习
📋 核心要点
- 现有方法在处理稀有故障事件时面临数据不足和泛化能力差的问题,导致识别效果不佳。
- 本文提出GAFT方法,通过几何先验引导视觉模型的微调,提升了模型对稀有故障的识别能力。
- 实验结果显示,GAFT在多个独立训练模型中表现优异,F2值显著提升,验证了其有效性。
📝 摘要(中文)
越野导航在物理结构导致不可恢复状态(如高中心或困陷)时可能失败,需人工干预。识别这些结构至关重要,但面临挑战。故障事件稀少且收集成本高,导致训练数据有限。收集的数据仅关联帧与结果,但未指明导致故障的视觉线索,直接学习可能导致场景特定视觉线索的利用,从而导致泛化能力差。为此,本文提出了一种参数高效的方法Geo-Anchored Fine-Tuning(GAFT),通过几何导出的先验来适应视觉基础模型,指导LoRA适应,并对齐空间注意力展开图与几何先验,同时保留预训练表示。在干预验证的森林危险基准上,GAFT在十个独立训练的适应模型中,始终优于冻结的DINOv2和监督的PEFT基线,重复的留一场景外平均F2从0.0607提升至0.3757,且在配对分析下具有统计显著性。
🔬 方法详解
问题定义:本文旨在解决越野导航中因物理结构导致的稀有故障识别问题。现有方法因缺乏足够的训练数据和视觉线索,导致模型泛化能力不足,无法有效识别故障原因。
核心思路:GAFT方法通过引入几何导出的先验信息,指导视觉模型的微调过程,确保模型能够更好地捕捉与故障相关的视觉特征,从而提升识别准确性。
技术框架:GAFT的整体架构包括数据收集、几何先验生成、LoRA适应和模型评估四个主要模块。首先收集与故障相关的数据,然后生成几何先验,接着通过LoRA进行模型微调,最后进行性能评估。
关键创新:GAFT的核心创新在于将几何先验与空间注意力机制结合,形成了一种新的微调策略。这一方法与传统的直接学习方法相比,能够更有效地利用稀有数据,提高模型的泛化能力。
关键设计:在GAFT中,采用了LoRA适应策略以减少参数调整的复杂性,同时设计了特定的损失函数来优化几何先验与模型输出之间的对齐,确保模型在保持预训练表示的基础上进行有效的微调。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GAFT在十个独立训练的模型中,重复的留一场景外F2值从0.0607提升至0.3757,最佳模型达到了0.570,显著优于冻结的DINOv2和监督的PEFT基线,验证了其有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人导航和灾害响应等场景。通过提高对稀有故障的识别能力,GAFT能够帮助系统在复杂环境中更安全地运行,减少人工干预的需求,提升整体效率。未来,该方法可能在更多实际应用中发挥重要作用,推动智能导航技术的发展。
📄 摘要(原文)
Off-road navigation can fail when physical structures induce irrecoverable states such as high-centering or entrapment, requiring human interventions. Identifying these structures is crucial, yet challenging. Such failure events are rare and costly to collect, resulting in limited training data. Moreover, the collected data associate frames with outcomes, but do not indicate the visual cues responsible for the failure. Learning directly from these data can therefore exploit scenario-specific visual cues, leading to poor generalization. We propose \textbf{Geo-Anchored Fine-Tuning (GAFT)}, a parameter-efficient method that adapts a vision foundation model with a geometry-derived prior. It guides LoRA adaptation by aligning a spatial attention-rollout map with the geometry prior, while preserving pretrained representations. On an intervention-verified forest hazard benchmark, across ten independently trained adaptations, GAFT consistently outperforms frozen DINOv2 and supervised PEFT baselines, improving the repeated leave-one-scenario-out mean $F_2$ from 0.0607 to 0.3757 with statistical significance under paired analysis. Within these independently trained models, the best-performing GAFT model achieves a repeated-LOSO $F_2$ of 0.570. Code and benchmark: https://github.com/Xu-Yanran/geo_anchored_fine_tuning