G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

📄 arXiv: 2608.19964v1 📥 PDF

作者: Bhavya Gupta, Onat Gungor, Tajana Rosing

分类: cs.LG

发布日期: 2026-08-20

备注: Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

🔗 代码/项目: GITHUB


💡 一句话要点

提出G-MARK以解决自主驾驶中的多代理推理问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自主驾驶 多代理推理 知识图 信息共享 运动预测 控制选择 轨迹规划

📋 核心要点

  1. 现有的合作驾驶方法在处理多代理证据时存在压缩信息的问题,导致无法清晰地理解物体的可见性和冲突信息。
  2. G-MARK通过构建显式的知识图,保留物体假设及其来源归属,增强了对多代理环境中信息的理解和推理能力。
  3. 实验结果表明,G-MARK在遮挡推理和控制选择方面显著提升了准确性,并且在通信效率上表现优异。

📝 摘要(中文)

自主驾驶系统必须在部分可观测的环境中运行,其中安全关键物体可能被遮挡或仅对邻近的连接车辆可见。车辆间的合作可以减少这种不确定性,但现有的合作驾驶方法往往将多代理证据压缩为潜在特征或隐藏的多模态状态,导致无法明确每个代理观察到的物体、物体是否对自我车辆可见以及冲突证据如何影响后续决策。我们提出了G-MARK,一个基于知识图的多代理推理框架,将合作的物体中心观察转化为显式的源归属知识图。G-MARK从这些知识图中推导出共享特征表示,支持物体推理、运动预测、控制选择和轨迹预测。与现有最先进的基线相比,G-MARK在遮挡推理准确性上提高了42.2%,控制选择错误率降低了13.1%,并以25.6倍更小的结构化通信负载实现了可比的轨迹规划准确性。

🔬 方法详解

问题定义:本论文旨在解决自主驾驶中多代理推理的挑战,尤其是在部分可观测环境下,现有方法无法有效处理代理之间的证据和信息共享,导致决策不准确。

核心思路:G-MARK的核心思路是通过构建知识图来明确物体的来源和可见性,从而增强多代理之间的合作与信息共享,改善决策过程。

技术框架:G-MARK的整体架构包括多个模块:首先,收集合作的物体中心观察数据;其次,构建知识图以保留物体假设及其源归属;最后,从知识图中推导出共享特征表示,支持后续的任务处理。

关键创新:G-MARK的主要创新在于将多代理推理与知识图结合,显著提高了信息的透明度和可追溯性,解决了现有方法中信息压缩导致的决策不确定性问题。

关键设计:在设计中,G-MARK采用了特定的损失函数以优化知识图的构建,同时在网络结构上引入了轻量级任务头,以支持不同的推理和预测任务。通过这些设计,G-MARK能够在保持高效性的同时,提升推理的准确性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,G-MARK在遮挡推理准确性上提高了42.2%,控制选择错误率降低了13.1%。此外,G-MARK在轨迹规划准确性上与最先进的基线相当,但通信负载减少了25.6倍,展现了其在效率和性能上的优势。

🎯 应用场景

该研究的潜在应用领域包括智能交通系统、自动驾驶汽车的协同控制以及车联网(V2X)技术。通过提高多代理间的信息共享和推理能力,G-MARK能够显著提升自主驾驶的安全性和效率,推动智能交通的进一步发展。

📄 摘要(原文)

Autonomous driving systems must operate under partial observability, where safety-critical objects may be occluded or visible only to neighboring connected vehicles. Vehicle-to-vehicle cooperation can reduce this uncertainty, but existing cooperative driving methods often compress multi-agent evidence into latent features or hidden multimodal states. As a result, they obscure which agent observed each object, whether the object is visible to the ego vehicle, and how conflicting evidence affects downstream decisions. We propose G-MARK, a grounded multi-agent reasoning framework that converts cooperative object-centric observations into explicit provenance-aware knowledge graphs (KGs). The resulting KGs preserve object hypotheses together with their source attribution, ego-versus-partner visibility, uncertainty, conflicts, spatial relations, and planning-relevant context. G-MARK then derives a shared feature representation from these KGs, enabling lightweight task heads to support object reasoning, motion prediction, control selection, and trajectory forecasting. Compared with the state-of-the-art baseline, GMARK improves occlusion reasoning accuracy by 42.2%, reduces control-selection error by 13.1%, and achieves comparable trajectory-planning accuracy with a 25.6x smaller structured communication payload. Our code is available at https://github.com/bhavyagupta98/g-mark.