VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

📄 arXiv: 2608.25872v1 📥 PDF

作者: Jiayi Chen, Wenlong Dong, Yan Huang, Xianglin Chen, Zijian Lin, Jiaqi Yin, Yushan Liu, Wenbo Ding

分类: cs.RO

发布日期: 2026-08-26


💡 一句话要点

提出VISTA-Policy以解决接触丰富操作中的反馈不足问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视觉模仿学习 接触丰富操作 视觉变形场 机器人抓取 动态干扰鲁棒性 能量聚合去噪 增量夹具动作

📋 核心要点

  1. 现有的视觉模仿学习方法在接触状态下的反馈不足,尤其在遮挡或微小交互时表现不佳。
  2. VISTA-Policy通过引入视觉变形场(VDF)作为高维反馈,结合物理感知编码和去噪机制,提升了交互信号的准确性。
  3. 实验结果显示,VISTA-Policy在多项任务中超越了纯视觉基线和触觉基线,展现出良好的泛化能力和鲁棒性。

📝 摘要(中文)

接触丰富的操作需要精确的交互反馈。尽管以视觉为中心的模仿学习广泛应用,但外部视觉观察在接触状态下提供的线索往往间接且模糊,尤其是在遮挡或微妙的物体与夹具交互时。为了解决这一问题,本文提出了VISTA-Policy,一个利用视觉变形场(VDF)作为高维视觉-物理反馈的模仿学习范式。该框架集成了实时VDF解码的物理感知编码引擎、隔离真实交互信号的能量聚合去噪机制,以及具有增量夹具动作的变形增强策略网络。大量评估表明,VISTA-Policy在多种操作任务中优于强基线方法,展示了在未见物体尺度上的显著泛化能力和对动态干扰的鲁棒性。

🔬 方法详解

问题定义:本文旨在解决接触丰富操作中反馈不足的问题,现有方法在遮挡或微小交互情况下的表现不理想,无法提供准确的接触状态信息。

核心思路:VISTA-Policy通过引入视觉变形场(VDF)作为高维视觉-物理反馈,结合实时解码和去噪机制,以提高交互信号的准确性和可靠性。

技术框架:该框架主要包括三个模块:1) 物理感知编码引擎,用于实时解码VDF;2) 能量聚合去噪机制,旨在隔离真实的交互信号;3) 变形增强策略网络,支持增量夹具动作以实现精确的闭环校正。

关键创新:VISTA-Policy的核心创新在于利用视觉变形场作为反馈,显著提升了接触状态的感知能力,区别于传统的视觉或触觉方法。

关键设计:在设计中,采用了特定的损失函数以优化去噪效果,并在网络结构上进行了调整,以适应增量夹具动作的需求。具体参数设置和网络架构细节在实验部分有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,VISTA-Policy在多项任务中显著优于强基线3D扩散策略和触觉基线,尤其在未见物体尺度上的泛化能力和对动态干扰的鲁棒性方面表现突出,提升幅度达到XX%。

🎯 应用场景

该研究的潜在应用领域包括机器人抓取、精细操作和人机交互等。通过提供更准确的接触反馈,VISTA-Policy能够在复杂和动态的环境中实现更高效的操作,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Contact-rich manipulation requires precise interaction feedback. While vision-centric imitation learning is prevalent, external visual observations provide indirect and ambiguous cues about contact states, particularly under occlusion or subtle object--gripper interactions; dedicated tactile or force sensors can provide rich contact information but introduce additional hardware complexity, calibration requirements, and deployment costs. To bridge this gap, we propose VISTA-Policy, an imitation learning paradigm that utilizes the Visual Deformation Field (VDF), a 3D displacement representation of a compliant gripper, as high-dimensional visuo-physical feedback. The framework integrates: 1) a Physics-Aware Encoding Engine for real-time VDF decoding; 2) an Energy Aggregation Denoising Mechanism to isolate true interaction signals; and 3) a Deformation-Augmented Policy Network with incremental gripper actions for precise closed-loop correction. Extensive evaluations on Cross-Scale Object Grasping, Cap Unscrewing, and Calligraphy Writing demonstrate that VISTA-Policy outperforms the strong pure-vision baseline 3D Diffusion Policy and the tactile baseline. VISTA-Policy further demonstrates substantial out-of-distribution generalization to unseen object scales and robustness against dynamic disturbances, offering a durable and cost-effective route toward general-purpose fine-grained manipulation in unstructured environments. Project videos and supplementary materials are available at: https://sites.google.com/view/vista-policy.