PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

📄 arXiv: 2608.26091v1 📥 PDF

作者: Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

分类: cs.IR, cs.CL, cs.CV

发布日期: 2026-08-26

备注: 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction


💡 一句话要点

提出PlanSightRAG以解决土木标准图纸合规检查问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 合规检查 多模态检索 视觉优先 自动化 土木工程 图纸推理 智能合成

📋 核心要点

  1. 现有的合规检查方法依赖人工阅读图纸,效率低且容易出错,OCR技术无法保留必要的几何信息。
  2. PlanSightRAG框架通过直接对图纸图像进行索引和推理,结合多模态检索和智能合成,提升了合规检查的自动化水平。
  3. 在实验中,PlanSightRAG在零-shot检索中达到了91.47%的Recall@5,且在合成图纸上实现了100%的裁决准确率,显著优于传统方法。

📝 摘要(中文)

土木基础设施合规检查长期以来依赖工程师手动阅读传统的二维图纸,然而基于OCR的自动化方法却剥离了理解这些图纸所需的几何和布局信息。本文提出了一种名为PlanSightRAG的视觉优先多模态检索增强生成框架。该框架直接对图纸图像进行索引和推理,集成了ColNomic-3B多向量检索、智能规划-检索-审计-合成器以及MaxSim热图作为证据轨迹。我们引入了来自五个州交通部门标准图纸的4,056对基准数据集(共1,898页)。PlanSightRAG在零-shot检索中达到了91.47%的Recall@5,而在保留的密歇根DOT语料库上则达到了91.40%。在合成的参数化合规图纸上,我们的Qwen2.5-VL-72B管道在提供预先解决的规则阈值时达到了100%的裁决准确率,而非VLM的OCR基线仅达到了76.4%。最后,我们展示了通过从规范语料库中直接提取数值限制来实现自主视觉规则定位,无需任何人工提供的规则。

🔬 方法详解

问题定义:本文旨在解决土木基础设施合规检查中,传统方法依赖人工阅读图纸的低效和OCR技术无法保留几何信息的问题。

核心思路:PlanSightRAG框架通过视觉优先的方式,直接对图纸图像进行索引和推理,结合多模态检索和智能合成,旨在提高合规检查的自动化和准确性。

技术框架:该框架包括多个主要模块:ColNomic-3B多向量检索用于信息检索,智能规划-检索-审计-合成器负责生成合规判断,MaxSim热图则作为证据轨迹提供可视化支持。

关键创新:最重要的创新在于将视觉信息与多模态检索相结合,直接在图像上进行推理,克服了传统OCR方法的局限性。

关键设计:在实验中,使用了4,056对标准图纸的基准数据集,设计了特定的规则阈值以提高裁决准确率,确保了系统在不同条件下的鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

PlanSightRAG在零-shot检索中达到了91.47%的Recall@5,并在密歇根DOT语料库上达到了91.40%。在合成图纸上,Qwen2.5-VL-72B管道在提供预先解决的规则阈值时实现了100%的裁决准确率,相较于传统OCR基线的76.4%有显著提升。

🎯 应用场景

该研究的潜在应用领域包括土木工程、建筑合规检查和基础设施管理等。通过自动化合规检查,能够显著提高工作效率,减少人工错误,并为工程师提供更可靠的决策支持,未来可能推动相关行业的数字化转型。

📄 摘要(原文)

Civil infrastructure compliance checking has long relied on engineers manually reading legacy 2D plans; however, OCR-based automation strips away the geometry and layout essential for interpreting these plans. We present a Visual-First Multimodal Retrieval-Augmented Generation (RAG) framework called PlanSightRAG. It indexes and reasons directly over plan imagery, integrates a ColNomic-3B multi-vector retrieval, an agentic Planner-Retriever-Auditor-Synthesizer, and MaxSim heatmaps as an evidence trail. We introduce a 4,056-pair benchmark from five state Departments of Transportation (DOT) standard plans (1,898 pages). PlanSightRAG achieves 91.47% Recall@5 on zero-shot retrieval, while on a held-out Michigan DOT corpus, it achieves 91.40%. On synthetic, parametrically-generated compliance drawings, our Qwen2.5-VL-72B pipeline reaches 100% verdict accuracy only when supplied a pre-resolved rule threshold, a controlled ceiling that a non-VLM OCR baseline already reaches at 76.4%. Finally, we demonstrate autonomous visual rule-grounding by extracting numeric limits directly from a specification corpus without any human-supplied rules.