Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152
作者: Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll
分类: cs.AI, cs.IR
发布日期: 2026-08-17
💡 一句话要点
提出RegulaRAG以解决合规场景生成问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 合规场景生成 大型语言模型 智能分块 图遍历 检索增强生成 汽车安全测试 联合国法规
📋 核心要点
- 现有的大型语言模型在生成符合复杂监管标准的测试场景时表现不佳,难以处理长篇和层次化的规范内容。
- RegulaRAG通过智能分块和图遍历技术,结合检索增强生成的方法,提升了生成场景的合规性和准确性。
- 实验结果表明,RegulaRAG在多个指标上优于现有基线系统,尤其在处理效率和鲁棒性方面表现突出。
📝 摘要(中文)
生成符合监管要求的测试场景对于验证安全关键的汽车系统至关重要,但现有的大型语言模型(LLMs)在处理长篇、层次化标准时存在困难。本文提出了RegulaRAG,一个检索增强生成(RAG)管道,结合了智能分块、通过图遍历对段落和表格进行参考感知的丰富处理,以及对这些丰富单元的智能检索与重排序。我们在手动策划的数据集上评估了该系统,涵盖了联合国第152号法规(AEBS)中的所有场景。研究包括:逐步搜索以识别近最优的检索参数、与五个基线RAG系统的对比、以及在源语料库中增加干扰内容的鲁棒性压力测试。所有实验中,RegulaRAG的平均Meta-Score达到82.99,超出第二名系统43%(NoRAG: 57.94),且在查询时处理14k-25k个token,而图中心基线则高达500k。即使在监管源数量增加时,RegulaRAG仍保持强劲表现,而竞争RAG系统则在质量和鲁棒性上急剧下降。
🔬 方法详解
问题定义:本文旨在解决生成符合联合国第152号法规的测试场景这一具体问题。现有方法在处理复杂的层次化标准时,往往无法有效地将输出与长文本内容相结合,导致生成结果的合规性不足。
核心思路:RegulaRAG的核心思路是通过智能分块(SmartChunking)和图遍历技术,增强段落和表格的参考信息,从而提高生成场景的合规性和准确性。该设计旨在有效利用长文本中的结构信息,提升生成的质量。
技术框架:RegulaRAG的整体架构包括三个主要模块:智能分块模块、参考感知丰富模块和智能检索与重排序模块。智能分块模块负责将长文本分解为可管理的单元,参考感知丰富模块通过图遍历增强这些单元的内容,最后智能检索与重排序模块则优化生成的场景。
关键创新:RegulaRAG的主要创新在于结合了智能分块和图遍历技术,使得生成的场景不仅符合监管要求,还能在处理效率上显著提升。这一方法与传统的RAG系统相比,能够更好地应对复杂的监管文本。
关键设计:在参数设置上,RegulaRAG采用了逐步搜索策略以识别最优检索参数,避免了耗时的网格搜索。此外,定制的惩罚评分指标用于评估输出的合规性和质量,确保生成结果的可靠性。整体系统在处理token数量上保持在14k-25k之间,显著低于图中心基线的500k。
🖼️ 关键图片
📊 实验亮点
在所有实验中,RegulaRAG的平均Meta-Score达到了82.99,超出第二名系统NoRAG的57.94,提升幅度达到43%。此外,RegulaRAG在处理效率上表现优异,查询时token数量仅为14k-25k,而竞争系统则高达500k,显示出更强的鲁棒性和稳定性。
🎯 应用场景
该研究的潜在应用领域包括汽车行业的安全测试、合规性验证以及其他需要遵循复杂法规的领域。通过生成符合监管要求的测试场景,RegulaRAG能够帮助企业提高产品的安全性和合规性,降低法律风险,具有重要的实际价值和未来影响。
📄 摘要(原文)
Generating regulation-compliant test scenarios is essential for validating safety-critical automotive systems, yet Large Language Models (LLMs) struggle to ground outputs in long, hierarchical standards. We present RegulaRAG, a Retrieval-Augmented Generation (RAG) pipeline that couples SmartChunking, reference-aware enrichment of paragraphs and tables via graph traversal, with Smart Retrieve & Rerank over these enriched units. To test our system, we evaluate on a manually curated dataset covering all scenarios in UN Regulation No. 152 (AEBS). Our study comprises: (i) a three-step progressive search that identifies near-optimal retrieval parameters without exhaustive grid search; (ii) head-to-head comparisons against five baseline RAG systems; and (iii) a robustness stress test that scales the source corpus with distractor content. Outputs are evaluated using a customized penalized scoring metric. Across all experiments, RegulaRAG achieves the highest average Meta-Score (82.99), outperforming the next-best system by 43% (NoRAG: 57.94), while operating at 14k-25k tokens per query versus up to 500k for graphcentric baselines. It maintains strong performance, remaining stable even as the number of regulatory sources grows, whereas competing RAG systems degrade sharply in both quality and robustness.