What Do CAE Simulation Agents Really Need Beyond a Generic Harness?
作者: Jiasheng Shi, Tianhan Zhang
分类: cs.CE, cs.CL, physics.comp-ph
发布日期: 2026-09-03
💡 一句话要点
提出CAE仿真代理以优化仿真设置与执行效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 计算机辅助工程 仿真代理 大型语言模型 执行反馈 信息访问 单代理系统 多代理分解
📋 核心要点
- 现有的CAE仿真代理在处理复杂仿真请求时,往往依赖于多代理系统,导致效率低下。
- 本文提出了一种单代理框架,旨在通过优化信息访问和修复机制,提升仿真设置的效率。
- 实验结果显示,单代理框架在FoamBench测试中达到了96.4%的准确率,相较于多代理系统的88.2%有显著提升。
📝 摘要(中文)
计算机辅助工程(CAE)仿真是工程领域中最复杂且需求量最大的领域之一,设置求解器如OpenFOAM、FEniCS或COMSOL需要专业知识。大型语言模型(LLM)代理有望将自然语言请求转化为有效的仿真。近期的CAE代理增加了仿真特定的机制,如多代理分解、领域检索和脚本反思。本文探讨了在信息访问和修复预算固定的情况下,CAE仿真代理除了通用框架外还需要什么。实验结果表明,单代理框架在性能上与多代理系统相当,且执行反馈修复显著提升了仿真效果。
🔬 方法详解
问题定义:本文旨在解决现有CAE仿真代理在处理复杂仿真请求时的效率低下问题,尤其是多代理系统的依赖性导致的性能瓶颈。
核心思路:通过设计一个单代理框架,优化信息访问和修复机制,减少对多代理系统的依赖,从而提高仿真设置的效率和准确性。
技术框架:整体架构包括信息获取、执行反馈和修复机制三个主要模块。信息获取模块负责从领域知识中提取必要信息,执行反馈模块用于实时监控仿真进程,修复机制则在出现错误时进行自动修复。
关键创新:最重要的技术创新在于通过执行反馈修复机制显著提升了仿真准确率,从71.8%提升至96.4%,而脚本反思并未对结果产生显著影响。
关键设计:在参数设置上,修复预算和信息访问策略经过精细调优,以确保在固定预算下实现最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,单代理框架在FoamBench测试中达到了96.4%的准确率,相较于无修复回合的71.8%有显著提升,且在与多代理系统的对比中表现优越,后者的准确率仅为88.2%。
🎯 应用场景
该研究的潜在应用领域包括航空航天、汽车工程和建筑设计等需要复杂仿真的行业。通过优化CAE仿真代理的效率,能够显著降低工程师的工作负担,提高仿真准确性,从而加速产品开发周期,提升市场竞争力。
📄 摘要(原文)
Computer-aided engineering (CAE) simulation is among the largest and most demanding areas of engineering, where setting up a solver such as OpenFOAM, FEniCS, or COMSOL takes real expertise. Large language model (LLM) agents promise to turn a natural-language request into a working simulation, and recent CAE agents add simulation-specific machinery: multi-agent decomposition, domain retrieval, and scripted reflection. That machinery suited weak base models; modern harnesses already supply multi-turn reasoning, tool use, and execution feedback. We ask what a CAE simulation agent still needs beyond a generic harness. With information access and repair budget held fixed, a single-agent harness matches or beats multi-agent specialized systems (FoamBench 96.4\% vs.\ 88.2\%). Ablations trace this to capabilities the harness already provides: execution-feedback repair lifts FoamBench from 71.8\% with no repair round to 96.4\%, while scripted reflection adds nothing. The one input that still helps is domain knowledge supplied as solver tutorials, our largest measured gain (80.9\% to 96.4\%).