CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

📄 arXiv: 2608.09296v1 📥 PDF

作者: Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

分类: cs.AI, cs.CV, cs.LG, cs.RO

发布日期: 2026-08-10


💡 一句话要点

提出CADEngBench以评估CAD模型的工程行为

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: CAD模型评估 参数化设计 装配推理 工程行为 有限元分析 设计验证 功能编辑

📋 核心要点

  1. 现有CAD模型评估方法主要关注外观,忽视了工程行为的验证,导致模型在实际应用中可能出现问题。
  2. CADEngBench通过双轨基准测试,分别评估参数化设计和装配推理能力,提供了更全面的CAD模型评估标准。
  3. 实验结果显示,编辑现有CAD模型相对容易,但复杂编辑和匹配FEA仍然具有挑战性,装配预测常常无法准确恢复连接件。

📝 摘要(中文)

CAD模型的工程级别不仅仅取决于其外观是否正确,还需满足设计要求、对参数变化做出可预测响应、支持受控编辑、在声明的分析下与参考结构响应匹配,并通过有效的连接件与其他部件相连。本文提出了CADEngBench,一个针对这些能力的双轨基准测试。CADEngBench-P评估300个参数化部件,通过边界表示有效性、工程和DFM检查、参数族扰动、功能编辑和线性静态有限元分析(FEA)进行600个任务的评估。CADEngBench-A则通过排名连接检索、精确面和边缘定位、连接框架预测和运动学验证评估150对部件。实验结果表明,CAD评估必须测试工程行为,而不仅仅是外观。

🔬 方法详解

问题定义:本文旨在解决现有CAD模型评估方法过于依赖外观的问题,缺乏对工程行为的全面测试。现有方法在实际应用中可能导致设计缺陷和功能失效。

核心思路:CADEngBench通过双轨评估框架,分别针对参数化设计和装配推理进行系统性测试,确保CAD模型不仅外观正确,还能在工程应用中表现良好。

技术框架:CADEngBench分为两个主要模块:CADEngBench-P和CADEngBench-A。前者评估300个参数化部件的设计和功能,后者评估150对部件的装配能力。每个模块包含多个评估指标和任务。

关键创新:CADEngBench的创新在于其双轨评估机制,强调工程行为的验证,而不仅仅是外观的正确性。这一方法与传统评估方法的本质区别在于其全面性和实用性。

关键设计:在评估过程中,CADEngBench-P采用了边界表示有效性、工程和DFM检查等多种技术指标,而CADEngBench-A则侧重于连接检索和运动学验证,确保评估的准确性和可靠性。实验中使用了CalculiX进行线性静态FEA分析。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,编辑现有CAD模型的难度显著低于生成新模型,复杂编辑和匹配FEA的成功率较低。装配预测虽然能够定位相关区域,但常常无法准确恢复连接件,显示出当前技术的局限性。

🎯 应用场景

CADEngBench的研究成果可广泛应用于机械设计、产品开发和工程教育等领域。通过提供更为全面的CAD模型评估标准,帮助工程师在设计阶段及时发现潜在问题,提高产品的可靠性和市场竞争力。未来,该方法还可扩展至其他工程领域的模型评估。

📄 摘要(原文)

A CAD model is not engineering-grade merely because it looks correct. It must satisfy design requirements, respond predictably to parameter changes, support controlled edits, match a reference structural response under a declared analysis, and connect to other parts through valid joints. We present CADEngBench, a two-track benchmark for these capabilities. CADEngBench-P evaluates 300 parametric parts, each used for one zero-to-CAD task and one functional-editing task (600 tasks in total), through boundary-representation (B-Rep) validity, engineering and DFM checks, parameter-family perturbations, functional editing, and matched linear-static FEA in CalculiX. CADEngBench-A evaluates 150 body pairs through ranked joint retrieval, exact face-and-edge grounding, joint-frame prediction, and kinematic verification. Across eight multimodal, code-capable models, editing supplied CAD is substantially easier than generating it, while complex edits and matched FEA remain difficult. Assembly predictions often locate the relevant region but fail to recover the recorded joint or mating entities. These results show that CAD evaluation must test engineering behavior rather than appearance alone.