MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

📄 arXiv: 2608.02449v1 📥 PDF

作者: Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

分类: cs.CV, cs.RO

发布日期: 2026-08-03

备注: 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026


💡 一句话要点

提出MoRAL以解决边缘计算平台上VLM的空间推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 空间推理 边缘计算 自动驾驶 多模态推理 鸟瞰图 物理编码 模型微调

📋 核心要点

  1. 现有的视觉语言模型在资源受限的自动驾驶平台上进行空间推理时,面临模型体积大和度量基础不可靠的挑战。
  2. 论文提出MoRAL,通过两阶段微调管道,首先对物理编码的鸟瞰图进行学习,然后基于此进行推理,以支持安全驾驶决策。
  3. 实验结果显示,MoRAL在多个问题类型上超越了零样本基线,尤其在紧急制动召回率上从10.8%提升至47.8%。

📝 摘要(中文)

在资源受限的自动驾驶平台上部署视觉语言模型(VLM)进行安全关键的空间推理,需要模型体积小且度量基础可靠。本文提出MoRAL(多模态推理用于自主语言模型),通过两阶段微调管道,教会Cosmos-Reason2-2B首先读取物理编码的鸟瞰图(BEV)表示,然后基于此进行驾驶决策推理。BEV图像将LiDAR度量距离编码为颜色带,将物体类别编码为聚类形态,并将雷达多普勒速度编码为方向楔形叠加,外部化空间感知至输入图像,从而在推理时无需学习的3D骨干网络。实验结果表明,MoRAL在使用四分之一参数的情况下,在多个驾驶问题类型上超越了零样本基线,尤其在需要结构化多步物理推理的问题上表现突出。

🔬 方法详解

问题定义:本文旨在解决在资源受限的自动驾驶平台上,视觉语言模型(VLM)在空间推理时面临的模型体积大和度量基础不可靠的问题。现有方法在零样本情况下无法生成可解析的BEV输出,表明词汇需要明确训练。

核心思路:论文的核心思路是通过两阶段的微调管道,首先对物理编码的BEV表示进行训练,然后利用该表示进行驾驶决策推理。这种设计使得在推理时无需依赖复杂的3D骨干网络,从而降低了计算资源的需求。

技术框架:整体架构包括两个主要阶段:第一阶段对视觉编码器进行微调,使用60,000个基础记录进行训练;第二阶段则对完整模型进行微调,使用57,696个由Cosmos-Reason2-8B生成的链式思维记录,涵盖八种驾驶问题类型。

关键创新:最重要的技术创新在于将LiDAR和雷达信息有效编码到BEV图像中,使得空间感知外部化,避免了对复杂3D模型的依赖。这一方法在参数使用上也显著优化,使用了52M参数,仅为总参数的2.4%。

关键设计:在微调过程中,使用了特定的损失函数和参数设置,以确保模型能够有效学习BEV表示和推理能力。通过对比实验,验证了模型在多步物理推理任务上的优势,尤其是在紧急制动等关键决策场景中的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,MoRAL在2,304个nuScenes帧的评估中,超越了零样本8B基线,在八种问题类型中赢得了七项,尤其在需要结构化多步物理推理的问题上表现最为突出。紧急制动召回率从10.8%提升至47.8%,输出退化率从94.1%降至20.8%。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、智能交通系统和机器人导航等。通过在边缘计算平台上实现紧凑且可靠的视觉语言模型,能够提升自动驾驶系统的安全性和决策能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

Deploying vision-language models (VLMs) for safety-critical spatial reasoning on resource-constrained autonomous driving platforms requires both compact model size and reliable metric grounding. We present MoRAL (Multimodal Reasoning for Autonomous Language Models), a two-stage fine-tuning pipeline that teaches Cosmos-Reason2-2B to first read a physics-encoded Bird's Eye View (BEV) representation and then reason over it for driving decisions. The BEV image encodes LiDAR metric distance as color bands, object class as cluster morphology, and radar Doppler velocity as directional wedge overlays, externalizing spatial perception into the input image so that no learned 3D backbone is required at inference. Stage 1 fine-tunes the vision encoder on 60,000 grounding records; zero-shot baselines produce no parseable BEV outputs, confirming the vocabulary requires explicit training. Stage 2 fine-tunes the full model (52M parameters, 2.4% of total) on 57,696 chain-of-thought records generated by Cosmos-Reason2-8B as teacher, spanning eight driving question types. On 2,304 held-out nuScenes frames evaluated by Gemma 4 (31B) calibrated against human review, MoRAL wins seven of eight question types over a zero-shot 8B baseline despite using four times fewer parameters, with the largest margins on question types requiring structured multi-step physics reasoning. Emergency braking recall improves from 10.8% to 47.8%, output degeneration falls from 94.1% to 20.8%, and the full pipeline fits a consumer 8 GB GPU at 42 tok/s without quantization. These results establish a reproducible foundation for compact, physics-grounded VLM reasoning on mobile edge platforms.