SG-AMP: Scene-Graph-Guided Active Perception and Semantics-Aware Motion Planning for Pepper Plants
作者: Rohit Menon, Shiva Rudra Lolla, Niklas Mueller-Goldingen, Gokul Chenchani, Ribana Roscher, Maren Bennewitz
分类: cs.RO
发布日期: 2026-09-01
💡 一句话要点
提出SG-AMP以解决辣椒植物的主动感知与运动规划问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱八:物理动画 (Physics-based Animation)
关键词: 主动感知 运动规划 场景图推理 深度补全 农业机器人
📋 核心要点
- 现有方法在处理植物场景时,往往无法有效推测未观察到的区域,导致感知和规划的局限性。
- SG-AMP通过集成深度补全、场景图推理和语义感知,提出了一种新的主动感知与运动规划框架。
- 在辣椒数据集上,感知网络的性能显著提升,语义mIoU达到55.27%,并且在不确定性处理上表现出色。
📝 摘要(中文)
我们提出了SG-AMP,集成了稳健的深度补全与输入条件不确定性、持久的全景映射、植物场景图推理以及语义感知的主动视图运动规划。该方法不仅能够检查不确定的观察区域,还通过场景图明确假设未观察到的辣椒-果梗连接,并将近距离传感器指向这些区域。候选视图根据预期信息增益进行选择,同时依赖于类别的运动成本将受保护的辣椒、果梗和茎与条件可遍历的叶片区分开。在辣椒数据上,感知网络达到了55.27%的语义mIoU、38.67%的PQ和40.62mm的深度RMSE,而输入条件不确定性将NYUv2的NLL从-1.6518提升至-1.6925,AUSE从0.0102降低至0.0087。
🔬 方法详解
问题定义:本论文旨在解决在辣椒植物场景中,如何有效进行主动感知和运动规划的问题。现有方法在处理不确定性和未观察区域时存在明显不足,导致感知效果不佳。
核心思路:SG-AMP的核心思路是通过场景图推理来假设未观察到的辣椒-果梗连接,并利用深度补全和语义信息来指导近距离传感器的运动规划,从而提高信息获取的效率。
技术框架:SG-AMP的整体架构包括多个模块:首先进行深度补全以处理输入数据的不确定性;其次,通过持久的全景映射构建环境模型;接着,利用场景图进行推理,最后进行基于语义的运动规划,选择最佳视图进行观察。
关键创新:SG-AMP的主要创新在于将场景图推理与主动感知相结合,能够有效地引导传感器关注未观察区域,显著提高信息获取的效率和准确性。这一方法与传统的被动感知方法有本质区别。
关键设计:在设计上,SG-AMP采用了输入条件不确定性来优化深度补全的过程,并在运动规划中引入了类别依赖的运动成本,以区分不同植物部分的保护和可遍历性。
🖼️ 关键图片
📊 实验亮点
在实验中,SG-AMP的感知网络在辣椒数据集上取得了55.27%的语义mIoU、38.67%的PQ和40.62mm的深度RMSE,显示出显著的性能提升。此外,输入条件不确定性使得NYUv2的NLL从-1.6518提升至-1.6925,AUSE从0.0102降低至0.0087,表明该方法在处理不确定性方面的有效性。
🎯 应用场景
该研究的潜在应用领域包括农业机器人、智能园艺和自动化植物监测系统。通过提高对植物生长状态的感知能力,SG-AMP能够帮助农民更有效地管理作物,提升产量和质量,具有重要的实际价值和未来影响。
📄 摘要(原文)
We present SG-AMP, integrating robust depth completion with input-conditioned uncertainty, persistent panoptic mapping, plant scene-graph reasoning, and semantics-aware active view-motion planning. Beyond inspecting uncertain observed regions, the scene graph explicitly hypothesizes unobserved pepper--peduncle attachments and directs close-range sensing toward them. Candidate views are selected according to expected information gain, while class-dependent motion costs distinguish protected peppers, peduncles, and stems from conditionally traversable foliage. On pepper data, the perception network achieves $55.27\%$ semantic mIoU, $38.67\%$ PQ, and $40.62\,\mathrm{mm}$ depth RMSE, while input-conditioned uncertainty improves NYUv2 NLL from $-1.6518$ to $-1.6925$ and AUSE from $0.0102$ to $0.0087$.