Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation

📄 arXiv: 2608.23224v1 📥 PDF

作者: Zhiruo Zhou, Zelin Li, Xiwen Chen, Jiazhuo Li, Chenwei Wang, Huiming Chen, Xiaojun Zhu

分类: cs.RO, cs.AI, cs.CV

发布日期: 2026-08-24


💡 一句话要点

提出TOWN-VLA以解决视觉-语言-动作操控中的干预问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 干预管理 提示权限 策略优化 机器人操控

📋 核心要点

  1. 现有方法在视觉-语言-动作操控中,检索文本的干预效果不佳,导致执行失败。
  2. 本文提出TOWN-VLA,通过提示权限接口分离候选生成与修改权限,确保有效的策略干预。
  3. 在多个实验中,成功率显著提升,如在LIBERO-Plus评估中从69.5%提高到73.1%。

📝 摘要(中文)

检索可以高效地增强冻结的视觉-语言-动作(VLA)策略,但一旦检索文本进入执行提示,它就成为控制干预。研究发现,原始附加文本会导致成功率从92.47%降至3.00%,而有意义和长度匹配的无意义附加文本在500个状态下均失败。这一结果揭示了“提示形式崩溃”的现象:改变指令形式而非添加有用语义会主导执行。为此,本文提出了TOWN-VLA(仅在需要时思考),一种提示权限接口,分离候选生成与修改策略输入的权限。通过固定的兼容性规则授权规范的简洁指令,否则接口将完全恢复原始基础提示。在900条审计路径中,所有路径遵循这一契约,成功率显著提升。

🔬 方法详解

问题定义:本文旨在解决在视觉-语言-动作操控中,检索文本作为干预时导致的执行失败问题。现有方法在执行过程中,附加的文本往往会导致策略性能显著下降,形成“提示形式崩溃”。

核心思路:论文提出TOWN-VLA,通过引入提示权限接口,确保只有在满足特定条件下才能修改策略输入,从而避免无效的干预。该设计旨在提高策略的稳定性和执行成功率。

技术框架:整体架构包括候选生成模块和权限验证模块。候选生成模块负责生成可能的干预文本,而权限验证模块则根据固定的兼容性规则判断是否允许修改原始提示。

关键创新:最重要的创新在于提示权限的引入,使得在冻结控制器的情况下,能够有效管理干预文本的使用。这一方法与传统的直接修改策略输入的方式有本质区别。

关键设计:在设计中,采用了固定的兼容性规则来授权简洁指令,并确保在不符合条件时恢复原始基础提示。实验中通过审计路径验证了该设计的有效性,确保了策略的稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在900条审计路径中,成功率从69.5%提升至73.1%,在物理PiPER臂上的成功率从52.7%提升至78.7%。这些结果表明,TOWN-VLA在多个干扰轴上均有显著改善,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人操控、智能助手和自动化系统等。通过有效管理干预文本,能够提高系统在复杂任务中的执行成功率,具有重要的实际价值和广泛的应用前景。未来,该方法有望在更多领域中推广,提升多模态系统的智能化水平。

📄 摘要(原文)

Retrieval can efficiently and effectively augment a frozen vision--language--action (VLA) policy without retraining, yet retrieved text becomes a control intervention once it enters the executed prompt. In a matched audit, raw appended text reduces mean success from 92.47\% to 3.00\%, while meaningful and length-matched meaningless appends both fail on all 500 states. This result identifies \emph{prompt-form collapse}: changing the instruction form, rather than adding useful semantics, can dominate execution. We introduce TOWN-VLA (Think Only When Needed), a prompt-authority interface that separates candidate generation from permission to alter the policy input. A fixed compatibility rule authorizes a canonical compact instruction; otherwise, the interface restores the original Base prompt exactly. Across 900 audited routes, every route follows this contract: 525 routes recover Base with matching hashes, and all 375 authorized prompts preserve the task signature. On a matched $4\times7$ LIBERO-Plus evaluation with 10{,}030 episodes per method, success rises from 69.5\% to 73.1\% ($+362$ episodes; 95\% CI 1.89--5.45 points), improving on six perturbation axes and all four suites. On a physical PiPER arm with a frozen \pizerofive{} checkpoint, success rises from 52.7\% to 78.7\% over 150 trials per method ($p=3.16\times10^{-6}$). Prompt authority is enforceable for a frozen controller; oracle-free admission calibration is the next deployment target.