Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation
作者: Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren
分类: cs.RO
发布日期: 2026-08-10
备注: 8 pages, 3 figures
💡 一句话要点
提出轨迹发散视界决策以解决双臂外科子任务操控问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 外科机器人 视觉-语言-动作 自适应控制 轨迹发散 动态环境 医疗自动化 远程手术
📋 核心要点
- 现有的视觉-语言-动作模型在外科操作中依赖固定长度的开环动作序列,导致在场景变化时容易出现累积误差。
- 论文提出了轨迹发散视界决策(TDHD)机制,通过实时评估动作可靠性来实现自适应执行控制,增强了外科操控的安全性和可靠性。
- 实验结果表明,TDHD在真实硬件上显著提升了针和组织操控的成功率,针操控成功率从55%提升至60%,组织操控成功率从55%提升至80%。
📝 摘要(中文)
随着临床工作负荷的增加,外科机器人系统的应用日益广泛,推动了对重复操控子任务的自主解决方案的需求。基于学习的控制器相比于基于规则和分析的方法具有更好的泛化能力,但大多数控制器仅针对单一任务进行训练,难以在不同程序中重用。视觉-语言-动作(VLA)模型提供了一个统一框架,整合了视觉感知、语言基础和动作生成,然而现有的VLA策略依赖于固定长度的开环动作序列,场景条件的变化可能导致累积误差和潜在风险。为此,本文将外科VLA部署形式化为自适应执行视界决策问题,提出了轨迹发散视界决策(TDHD)机制,通过测量在小噪声扰动下生成的两个流匹配轨迹之间的发散度来估计逐步动作的可靠性,并使用双阈值规则触发及时的重新规划。我们还建立了一个真实的类似da Vinci的双臂基准,收集了600个跨针(到达、拾取、重新抓取)和组织(到达、提升、切除)操控套件的远程操作演示。
🔬 方法详解
问题定义:本文旨在解决外科机器人在动态环境下执行任务时,因固定长度开环动作序列导致的累积误差和潜在风险的问题。现有的视觉-语言-动作模型在面对变化的场景条件时,难以保证操作的可靠性。
核心思路:提出轨迹发散视界决策(TDHD)机制,通过实时评估生成轨迹的可靠性,动态调整执行策略,从而提高外科操控的安全性和有效性。该机制能够根据环境变化及时触发重新规划,避免错误的累积。
技术框架:整体架构包括视觉感知模块、语言理解模块和动作生成模块。TDHD机制在执行过程中实时监测轨迹的发散情况,并通过双阈值规则决定是否需要重新规划。
关键创新:TDHD机制是本文的核心创新点,通过测量轨迹发散度来评估动作的可靠性,显著区别于传统的固定策略方法,能够适应动态变化的外科环境。
关键设计:在设计中,采用了流匹配生成轨迹的方法,并设置了适当的噪声扰动范围,以确保发散度的测量准确性。同时,双阈值规则的设计使得系统能够在不同的环境条件下灵活调整执行策略。
🖼️ 关键图片
📊 实验亮点
实验结果显示,TDHD机制在真实硬件上进行的20次试验中,针操控的成功率从55%提升至60%,组织操控的成功率从55%提升至80%。这一显著提升主要发生在操作的最后阶段,表明自适应执行控制的重要性。
🎯 应用场景
该研究的潜在应用领域包括外科手术机器人、医疗自动化和远程手术等。通过提高外科操控的可靠性,能够在实际手术中减少风险,提升患者安全性,并为未来的医疗机器人技术发展奠定基础。
📄 摘要(原文)
Surgical robotic systems are increasingly being adopted as clinical workload rises, motivating autonomous solutions for repetitive manipulation subtasks. Learning-based controllers improve generalization compared with rule-based and analytic approaches, but most are trained for individual tasks and remain difficult to reuse across procedures. Vision-Language-Action (VLA) models provide a unified framework that integrates visual perception, language grounding, and action generation, offering a promising path toward more composable surgical autonomy. However, existing VLA policies rely on fixed-length open-loop action sequences, where changing scene conditions can lead to accumulated errors and potential risks in surgical manipulation. To mitigate this issue, we formulate surgical VLA deployment as an adaptive execution-horizon decision problem and propose Trajectory Divergence Horizon Decision (TDHD), a test-time mechanism that estimates step-wise action reliability by measuring the divergence between two flow-matching-generated trajectories under small noise perturbations and truncates execution using a dual-threshold rule to trigger timely replanning. We further establish a real-world da Vinci-like dual-arm benchmark with synchronized multi-view perception and language instructions, and collect 600 teleoperated demonstrations across needle (reach, pick, regrasp) and tissue (reach, lift, resection) manipulation suites. On real hardware with 20 trials per task setting, TDHD consistently improves performance over the latest VLA baselines: success increases from 55\% to 60\% for needle manipulation and from 55\% to 80\% for tissue manipulation, with the largest gains observed in the final manipulation stages. These results highlight the importance of adaptive execution control for reliable deployment of VLA models in surgical robotic manipulation.