Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training

📄 arXiv: 2608.02545v1 📥 PDF

作者: Yanliang Huang, Zhuocheng Zhang, Peng Xie, Zhen Zhang, Wenyuan Wu, Majid Khadiv, Zhuoqi Zeng, Amr Alanwar

分类: cs.RO

发布日期: 2026-08-03


💡 一句话要点

提出基于集合训练的可达动作验证方法以解决视觉运动策略问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 视觉运动策略 可达性分析 集合传播 区域体 机器人操作 自动驾驶 人机交互

📋 核心要点

  1. 现有方法在视觉运动策略的可达性分析中面临计算成本高和保守性过强的挑战。
  2. 论文提出冻结视觉编码器并在低维接口上进行集合传播的解决方案,以优化输出包围宽度。
  3. 实验结果表明,基于集合的训练能够在保持任务能力的同时显著减少可达动作半径。

📝 摘要(中文)

针对视觉运动策略的可达性分析存在困难,因为大型视觉编码器使得端到端的集合传播计算成本高且过于保守。为此,本文冻结视觉编码器,并将集合传播限制在其与下游策略之间的低维接口上,该接口集通过保留的相机姿态扰动进行校准。通过使用区域体传播该集合,直接优化终端输出包围宽度。在评估过程中,从规定的分布中采样相机姿态扰动,并通过回滚级别的分裂保形校准将结果的动作偏差分数转换为具有有限样本覆盖的概率可达动作半径。在受控操作实验中,基于集合的训练在保持闭环任务能力的同时减少了该半径,而匹配行为、观察一致性和逐点对抗控制均留下了更大的半径。

🔬 方法详解

问题定义:本文旨在解决视觉运动策略的可达性分析问题,现有方法由于大型视觉编码器导致计算成本高且过于保守,限制了其实用性。

核心思路:通过冻结视觉编码器并在其与下游策略之间的低维接口上进行集合传播,优化输出包围宽度,从而提高可达性分析的效率和准确性。

技术框架:整体架构包括冻结的视觉编码器、低维接口的集合传播模块和基于区域体的策略优化模块。评估阶段通过采样相机姿态扰动并进行回滚级别的校准来获得概率可达动作半径。

关键创新:最重要的创新在于将集合传播限制在低维接口上,显著降低了计算复杂度,并通过直接优化输出包围宽度来提高可达性分析的准确性。

关键设计:关键设计包括使用区域体进行集合传播,损失函数的选择以优化输出包围宽度,以及在评估过程中采用分裂保形校准技术以获得概率可达动作半径。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,基于集合的训练显著减少了可达动作半径,相较于匹配行为、观察一致性和逐点对抗控制,减少幅度更为明显,表明该方法在保持闭环任务能力的同时提升了策略的可达性。

🎯 应用场景

该研究在机器人操作、自动驾驶和人机交互等领域具有广泛的应用潜力。通过提高视觉运动策略的可达性分析效率,能够更好地支持复杂任务的执行,提升系统的智能化水平和安全性。

📄 摘要(原文)

Reachability analysis for visuomotor policies is difficult because large visual encoders make end-to-end set propagation computationally expensive and excessively conservative. We therefore freeze the visual encoder and confine set propagation to a low-dimensional interface between it and the downstream policy, with the interface set calibrated from held-out camera-pose perturbations. Propagating this set through the policy with zonotopes yields a terminal output-enclosure width that set-based training optimizes directly. During evaluation, camera-pose perturbations are sampled from the prescribed distribution, and rollout-level split conformal calibration converts the resulting action-deviation scores into a probabilistic reachable-action radius with finite-sample coverage. In controlled manipulation experiments, set-based training reduces this radius while preserving closed-loop task capability, and matched behavior-only, observational-consistency, and pointwise-adversarial controls all leave a larger radius.