XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

📄 arXiv: 2608.10976v1 📥 PDF

作者: Foundation Model Team, XPeng Inc

分类: cs.AI

发布日期: 2026-08-11


💡 一句话要点

提出XCoT-VLA以解决实时控制中的推理效率问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自动驾驶 多模态学习 轨迹生成 推理优化 深度学习

📋 核心要点

  1. 现有的链式推理方法在实时控制中表现不佳,导致推理效率低下,难以满足自动驾驶的需求。
  2. XCoT-VLA通过引入可执行的CoT令牌,利用Reason-Action监督学习,优化了推理过程并提高了实时性。
  3. 实验结果显示,XCoT-VLA在多个指标上均有显著提升,尤其是在轨迹生成的准确性和效率上。

📝 摘要(中文)

Vision-Language-Action (VLA) 模型能够将场景理解、语义推理和轨迹生成连接起来,以实现自动驾驶。然而,现有的冗长自然语言链式推理(CoT)不适合实时控制,因为其开放性、解码成本高且难以优化。为此,本文提出了XCoT-VLA,通过用紧凑的可执行CoT令牌替代描述性推理,利用自动构建的Reason-Action监督进行学习。预测的XCoT序列在上下文中保持一致,并通过共享的多模态自注意力机制条件化固定轨迹查询。实验结果表明,XCoT-VLA在一般分布集上将纵向ADE从1.645降低到1.323,在变道场景中将横向FDE从1.616降低到0.648,显著减少了自回归推理的开销,满足实时规划的需求。

🔬 方法详解

问题定义:本文旨在解决现有VLA模型在实时控制中推理效率低下的问题,尤其是冗长的自然语言链式推理不适合快速决策。

核心思路:提出XCoT-VLA模型,通过引入紧凑的可执行CoT令牌,利用自动构建的Reason-Action监督来优化推理过程,使其更适合实时控制。

技术框架:XCoT-VLA的整体架构包括多个模块:首先通过共享的多模态自注意力机制处理场景上下文,然后应用确定性令牌-功能路由,将Reason FFN应用于XCoT令牌,将Control FFN应用于轨迹查询,最终生成匹配的轨迹。

关键创新:最重要的创新在于将描述性推理替换为可执行的CoT令牌,这一设计使得推理过程更加紧凑且高效,显著降低了自回归推理的开销。

关键设计:在模型设计中,采用了Reason FFN和Control FFN的分离结构,确保了推理和控制的高效协同,同时通过XCoT Policy Optimization (XCPO)进行可选的精细化调整。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,XCoT-VLA在纵向ADE上从1.645降低至1.323,在变道场景中横向FDE从1.616降低至0.648,显示出显著的性能提升,证明了该方法在实时轨迹生成中的有效性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、智能交通系统和机器人控制等。通过提高推理效率和轨迹生成的准确性,XCoT-VLA能够在复杂的动态环境中实现更安全和高效的自动驾驶,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision-Language-Action (VLA) models can connect scene understanding, semantic reasoning, and trajectory generation for autonomous driving. However, verbose natural-language Chain-of-Thought (CoT) is poorly suited to real-time control because it is open-ended, costly to decode, and difficult to optimize as an action-facing representation. We propose XCoT-VLA, which replaces descriptive rationales with compact executable CoT tokens learned from automatically constructed Reason-Action supervision. Logged trajectories provide action evidence, while scene context supplies causal semantics. The predicted XCoT sequence remains in context and conditions fixed trajectory queries through shared multimodal self-attention. Deterministic token-function routing applies the Reason FFN to XCoT tokens and the Control FFN to trajectory queries for flow-matching trajectory generation. We further introduce XCoT Policy Optimization (XCPO) as an optional refinement extension in the same executable token space. XCoT-VLA reduces longitudinal ADE from 1.645 to 1.323 on a general-distribution set and lateral FDE from 1.616 to 0.648 in lane-change scenarios. By representing driving-oriented reasoning with only 2-6 executable XCoT tokens, our method substantially reduces autoregressive reasoning overhead and remains within the real-time planning budget. These results demonstrate that driving-oriented reasoning can be compact, executable, and directly connected to trajectory generation.