SimSkill: A Lifelong Learning AI Agent for Autonomous Mastery of Traffic Simulation

📄 arXiv: 2609.03753v1 📥 PDF

作者: Qi Liu, Qinzheng Wang, Yiming Bie

分类: cs.AI, cs.MA

发布日期: 2026-09-03

🔗 代码/项目: GITHUB


💡 一句话要点

提出SimSkill以实现交通仿真中的自主学习与能力提升

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自主学习 交通仿真 能力积累 环境驱动 记忆整合 智能交通 大型语言模型

📋 核心要点

  1. 现有方法在长期学习和能力积累方面存在不足,难以有效应对复杂的交通仿真任务。
  2. SimSkill通过自主探索和环境驱动的任务生成,识别能力差距并整合经验,构建可重用的知识库。
  3. 实验结果表明,SimSkill在验证完成率上提高了最多25个百分点,显示出程序和语义记忆的互补作用。

📝 摘要(中文)

随着大型语言模型(LLMs)能力的增强,AI系统的长期价值不仅在于解决个别请求,还在于将经验和积累的知识转化为持久、可重用的能力。本文介绍了SimSkill,一个基于城市交通仿真模拟器(SUMO)的自我进化代理。SimSkill识别能力差距,生成并解决环境驱动的任务,通过行动-评论循环验证解决方案,并将经验整合为情节、程序和语义记忆,而无需更新主干模型。通过自主探索,它构建了一个涵盖交通仿真工作流的可重用库。我们在两个保留基准上评估SimSkill,使用三种主干LLM和独立的基于工件的验证。SimSkill的验证完成率提高了最多25个百分点,而消融实验显示程序和语义记忆的互补贡献。其效益依赖于主干和预算:记忆并不改善每个模型或均匀降低推理成本。更广泛地说,SimSkill展示了一种设计范式,其中自然语言保留并组合计算能力,而可执行工具和代码提供精确和可重复的执行。

🔬 方法详解

问题定义:本文旨在解决AI系统在交通仿真中长期学习和能力积累的挑战。现有方法往往无法有效利用积累的经验,导致能力提升缓慢。

核心思路:SimSkill的核心思想是通过自主探索识别能力差距,并生成与环境相关的任务来填补这些差距,从而实现自我进化。这样的设计使得代理能够在不更新主干模型的情况下,持续积累和整合经验。

技术框架:SimSkill的整体架构包括能力识别模块、任务生成模块、解决方案验证模块和记忆整合模块。代理通过行动-评论循环不断优化其策略,并将经验存储在情节、程序和语义记忆中。

关键创新:SimSkill的主要创新在于其无需更新主干模型即可实现自我进化的能力,利用环境驱动的任务生成和多种记忆形式的整合,显著提升了学习效率和能力的可重用性。

关键设计:在设计中,SimSkill采用了多种记忆结构,包括情节记忆、程序记忆和语义记忆,以便在不同场景下灵活应用。此外,行动-评论循环的设计确保了解决方案的有效性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SimSkill在两个保留基准上的实验结果显示,其验证完成率提高了最多25个百分点,显著优于基线模型。消融实验表明,程序和语义记忆的互补贡献在提升性能方面发挥了重要作用,展示了不同记忆形式的有效性和必要性。

🎯 应用场景

SimSkill的研究成果在智能交通系统、自动驾驶车辆和城市交通管理等领域具有广泛的应用潜力。通过提升AI在复杂环境中的自主学习能力,能够有效改善交通流量管理和安全性,推动智能交通技术的发展。未来,SimSkill还可能应用于其他需要长期学习和能力积累的领域,如机器人和人机交互。

📄 摘要(原文)

As large language models (LLMs) become increasingly capable, the long-term value of AI systems depends not only on solving individual requests, but also on transforming experience and accumulated knowledge into durable, reusable competence. We introduce SimSkill, a self-evolving agent built around the Simulation of Urban MObility (SUMO) traffic simulator. SimSkill identifies capability gaps, generates and solves environment-grounded tasks, verifies solutions through an action--critic loop, and consolidates experience into episodic, procedural, and semantic memory without updating the backbone model. Through autonomous exploration, it builds a reusable library spanning the traffic-simulation workflow. We evaluate SimSkill on two held-out benchmarks with three backbone LLMs and independent artifact-based verification. SimSkill improves verified completion by up to 25 percentage points, while ablations show complementary contributions from procedural and semantic memory. Its benefits remain backbone- and budget-dependent: memory does not improve every model or uniformly reduce inference cost. More broadly, SimSkill illustrates a design paradigm in which natural language preserves and composes computational capabilities, while executable tools and code provide precise and reproducible execution. All code and experimental data are publicly available at https://github.com/qiliuchn/SimSkill-V1.