Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model

📄 arXiv: 2608.20556v1 📥 PDF

作者: Celina Shiyu Wang, Yiqi Zhao, Junjie Ye, Yue Wang, Jyotirmoy V. Deshmukh

分类: cs.RO, cs.LO, eess.SY

发布日期: 2026-08-20


💡 一句话要点

提出Logic-VLA以解决视觉语言行动模型的安全性与时序要求问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言行动 信号时序逻辑 策略适应 四旋翼导航 安全关键任务 时序要求 模型优化

📋 核心要点

  1. 现有的视觉语言行动模型在处理安全关键或时序要求时存在不足,无法精确满足这些需求。
  2. 论文提出的Logic-VLA模型通过引入信号时序逻辑(STL)规范,在推理时进行条件化,从而增强了模型的安全性和时序适应性。
  3. 实验结果表明,Logic-VLA在STL满足率上显著提升,且对自然语言任务的影响最小,展示了其在多样化要求下的适应能力。

📝 摘要(中文)

视觉语言行动(VLA)模型能够遵循自然语言任务指令,但这些指令可能无法精确指定安全关键或时空要求。我们提出了Logic-VLA,这是一种在推理时基于信号时序逻辑(STL)规范进行条件化的正式要求感知VLA。Logic-VLA使用基于语法图的STL编码器进行预训练,以捕捉时序逻辑语义。策略适应分为两个阶段:首先在满足演示上进行STL条件的监督微调,然后使用流匹配替代品进行匹配的满足-违反轨迹对的轨迹级偏好优化。这一方法在保持自然语言任务的同时,提高了正式要求的满足率。我们在随机化的真实感环境中评估了Logic-VLA在闭环四旋翼导航模拟中的表现,并测试了对训练期间未见STL公式的泛化能力。评估基准显示,Logic-VLA在STL满足率上比盲STL基线政策提高了24.8到40.7个百分点,同时自然语言任务成功率最多降低1.8个百分点,表明单一VLA能够适应不同的正式要求,而无需为每个规范单独设计策略。

🔬 方法详解

问题定义:本论文旨在解决现有视觉语言行动模型在执行自然语言任务时,无法满足安全性和时序要求的问题。现有方法在处理复杂环境和正式要求时表现不佳,导致潜在的安全隐患。

核心思路:Logic-VLA通过引入信号时序逻辑(STL)规范,在推理阶段对模型进行条件化,使其能够在执行任务时同时考虑安全和时序要求。这种设计使得模型能够在不牺牲自然语言任务成功率的情况下,满足更高的正式要求。

技术框架:Logic-VLA的整体架构包括两个主要阶段:首先是基于STL的监督微调,利用满足的演示数据进行训练;其次是轨迹级偏好优化,通过流匹配替代品对满足和违反的轨迹对进行优化,以提升模型的表现。

关键创新:本研究的关键创新在于引入了基于语法图的STL编码器,能够有效捕捉时序逻辑的语义,并通过双阶段策略适应机制,显著提高了模型对正式要求的满足率。这与传统的VLA模型形成了鲜明对比,后者通常缺乏对正式要求的考虑。

关键设计:在模型设计中,采用了流匹配替代品作为优化目标,确保了在满足正式要求的同时,保持自然语言任务的成功率。此外,STL编码器的预训练过程也为模型提供了强大的时序逻辑理解能力。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在实验中,Logic-VLA在STL满足率上比盲STL基线政策提高了24.8到40.7个百分点,而自然语言任务的成功率仅降低了最多1.8个百分点。这表明该模型在满足正式要求的同时,几乎没有影响其执行自然语言任务的能力,展示了其优越的适应性。

🎯 应用场景

Logic-VLA的研究成果在多个领域具有广泛的应用潜力,尤其是在无人机导航、自动驾驶和机器人控制等安全关键的任务中。通过确保模型能够理解并遵循复杂的时序和安全要求,该模型可以有效提升系统的可靠性和安全性,未来可能在智能交通、无人机配送等场景中发挥重要作用。

📄 摘要(原文)

Vision-language-action (VLA) models can follow natural-language (NL) task instructions, but such instructions may not precisely specify safety-critical or spatiotemporal requirements on the resulting behavior. We introduce Logic-VLA, a formal-requirement-aware VLA that conditions on Signal Temporal Logic (STL) specifications supplied at inference time. Logic-VLA uses a syntax-graph-based STL encoder pre-trained to capture temporal logic semantics. Policy adaptation proceeds in two stages: STL-conditioned supervised fine-tuning on satisfying demonstrations is followed by trajectory-level preference optimization over matched satisfying-violating rollout pairs using a flow-matching surrogate for Identity Preference Optimization. This formulation improves formal requirement satisfaction while preserving the nominal NL task. We evaluate Logic-VLA in closed-loop quadcopter navigation simulation across randomized photorealistic environments and test generalization to STL formulas unseen during training. Across the evaluation benchmarks, Logic-VLA improves STL satisfaction rate over an STL-blind base policy by 24.8 to 40.7 percentage points (pp) while reducing nominal NL task success by at most 1.8 pp, showing that a single VLA can adapt its behavior to varying formal requirements without requiring a separate policy for each specification.