TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
作者: Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue Li, Xiangyang Gu, Yuhan Cao, Xiao Xia, Yanzhe Hu, Zhijie Deng
分类: cs.RO, cs.LG
发布日期: 2026-08-26
备注: 15 pages, 6 figures
💡 一句话要点
提出TacForcing以解决接触丰富操作中的时效性反馈问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 流式动作生成 触觉反馈 接触丰富操作 执行感知 机器人技术
📋 核心要点
- 现有的视觉-语言-动作模型在执行过程中无法有效利用触觉反馈,导致动作执行的适应性不足。
- TacForcing通过引入流式动作专家,实时生成基于触觉反馈的动作,避免了传统方法的时效性问题。
- 在多项任务中,TacForcing的成功率显著高于现有方法,展示了其在接触丰富操作中的有效性。
📝 摘要(中文)
接触丰富的操作需要适应在动作执行过程中不断变化的接触状态。然而,现有的基于块的视觉-语言-动作模型在执行前预测完整的动作块,导致在执行过程中触觉条件失效。现有的触觉反应方法通常依赖于独立的高频控制器,增加了架构和训练的复杂性。本文提出了TacForcing,一个流式动作生成框架,有效地结合了执行时的触觉反馈。TacForcing用流式动作专家替代标准动作专家,生成基于执行过程中获取的触觉观察的动作,并引入执行感知触觉注意力(EATA),将触觉条件限制在即将执行的动作上,从而减少触觉获取与动作执行之间的时间不匹配。在六个模拟的UniVTAC任务和三个真实的接触丰富操作任务中,TacForcing分别实现了65%和69%的平均成功率,超越了强基线。
🔬 方法详解
问题定义:本文旨在解决在接触丰富操作中,现有方法无法有效利用执行时触觉反馈的问题。传统的块状模型在执行前预测动作,导致触觉信息失效,影响操作的适应性。
核心思路:TacForcing的核心思想是通过流式动作专家实时生成动作,基于执行过程中获取的触觉信息进行调整,避免了传统方法的时效性问题。
技术框架:TacForcing的整体架构包括流式动作生成模块和执行感知触觉注意力(EATA)模块。流式动作生成模块负责根据实时触觉反馈生成动作,而EATA模块则确保触觉信息仅用于即将执行的动作,从而减少时间不匹配。
关键创新:TacForcing的主要创新在于用流式动作专家替代传统的动作专家,实时生成动作并结合触觉反馈。这一设计使得系统能够在执行过程中动态调整动作,提高了操作的灵活性和成功率。
关键设计:在设计中,TacForcing采用了特定的损失函数来优化动作生成的实时性,并通过网络结构的调整来增强对触觉信息的敏感性,确保系统能够快速响应环境变化。
🖼️ 关键图片
📊 实验亮点
TacForcing在六个模拟的UniVTAC任务中实现了65%的平均成功率,在三个真实的接触丰富操作任务中达到了69%的成功率,均显著高于现有强基线,展示了其在实时触觉反馈利用方面的优势。
🎯 应用场景
TacForcing的研究成果在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过实时利用触觉反馈,该方法能够提升机器人在复杂环境中的操作能力,增强其适应性和灵活性,未来可能推动智能机器人技术的发展。
📄 摘要(原文)
Contact-rich manipulation requires adapting to contact states that can evolve substantially within an action horizon. However, chunk-based vision-language-action models predict complete action chunks from observations collected before execution, leaving tactile conditioning stale during execution. Existing tactile-reactive approaches typically rely on separate high-frequency controllers, which increase both architectural and training complexity. In this paper, we introduce TacForcing, a streaming action-generation framework that effectively incorporates execution-time tactile feedback. Instead of employing a separate reactive controller, TacForcing replaces the standard action expert with a streaming action expert to generate actions conditioned on the evolving tactile observations acquired during execution. TacForcing also introduces Execution-Aware Tactile Attention (EATA), which restricts tactile conditioning to actions nearing execution, thereby reducing the temporal mismatch between tactile acquisition and action execution. Across six simulated UniVTAC tasks and three real-world contact-rich manipulation tasks, TacForcing achieves average success rates of 65% and 69%, respectively, outperforming strong baselines in both settings.