NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation
作者: Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu
分类: eess.SY, cs.AI
发布日期: 2026-08-12
备注: accepted by MLCAD 2026
💡 一句话要点
提出NetlistBench以评估LLM在SPICE网表识别与操作中的可靠性
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 电路设计 SPICE网表 结构验证 自动化设计 性能评估 基准测试
📋 核心要点
- 现有方法对LLM在SPICE网表识别与操作中的可靠性缺乏深入理解,且未能有效区分高层设计推理与底层操作。
- 本文提出NetlistBench基准,通过结构验证的方法评估LLM在SPICE网表的识别和操作能力,涵盖多种任务类型。
- 实验结果表明,简单操作的准确率高达100%,但复杂操作的准确率显著降低,显示出LLM在电路设计中的局限性。
📝 摘要(中文)
大型语言模型(LLMs)在电路设计工作流程中的应用日益增加,但其在面对SPICE网表的识别和操作时的可靠性仍然不够明确,且很少与高层设计推理分开讨论。本文提出了NetlistBench,这是一个结构验证的SPICE网表识别和操作基准,包含2342个案例,涵盖参数和连通性识别与编辑、层次操作、等效判断和长时间复合编辑。通过确定性结构感知的oracle评估模型输出。实验结果显示,简单的局部编辑准确率达到96%-100%,而设备添加的准确率降至41%-83%,等效判断则为49%-90%。启用推理显著改善了较弱模型的表现,但并未消除结构保持失败的问题,随着编辑范围的增加,性能仍然急剧下降。NetlistBench明确指出网表可靠性是基于LLM的电路设计自动化中的一个独特瓶颈。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在SPICE网表识别与操作中的可靠性问题,现有方法未能有效评估其在电路设计中的实际应用能力。
核心思路:提出NetlistBench基准,通过结构验证的方式评估LLM在多种电路操作任务中的表现,确保模型输出的准确性和可靠性。
技术框架:NetlistBench包含2342个案例,涵盖参数识别、连通性编辑、层次操作等多个任务,使用确定性结构感知的oracle进行评估。
关键创新:NetlistBench的设计使得LLM的性能评估不仅限于高层推理,还包括底层结构操作,填补了现有研究的空白。
关键设计:在实验中,模型输出的评估采用了结构感知的oracle,确保了对复杂操作的准确性评估,同时分析了不同操作复杂度对模型性能的影响。
🖼️ 关键图片
📊 实验亮点
实验结果显示,简单局部编辑的准确率高达96%-100%,而设备添加的准确率降至41%-83%,等效判断的准确率为49%-90%。启用推理显著改善了模型表现,但未能消除结构保持失败,随着编辑范围的增加,性能急剧下降。
🎯 应用场景
该研究的潜在应用领域包括电路设计自动化、电子设计自动化(EDA)工具的开发,以及基于LLM的智能电路设计助手。通过提高LLM在网表操作中的可靠性,能够推动电路设计的智能化进程,提升设计效率和准确性。
📄 摘要(原文)
Large Language Models (LLMs) are increasingly used in circuit design workflows, yet their reliability on simulator-facing SPICE netlist recognition and manipulation remains poorly understood and is rarely separated from high-level design reasoning. Although netlists are textual, they encode structured circuit objects through topology and parameters. We present \textbf{NetlistBench}, a structure-verified benchmark for SPICE netlist recognition and manipulation. NetlistBench contains 2,342 cases across 24 task families, covering parameter and connectivity recognition and edits, hierarchical operations, equivalence judgment, and long-horizon compound editing. Model outputs are evaluated by a deterministic structure-aware oracle. Across six non-thinking LLMs, performance varies substantially with operation-level structural complexity. Simple local edits reach $96\%$--$100\%$ accuracy, while device addition drops to $41\%$--$83\%$ and equivalence judgment to $49\%$--$90\%$. Enabling reasoning substantially improves weaker models but does not eliminate structure-preservation failures, with performance still degrading sharply as the edit horizon increases. NetlistBench identifies netlist reliability as a distinct bottleneck for trustworthy LLM-based circuit design automation.