Minimal Local Simulation Foundations for LLM- and VLM-Driven Agents in 2D and 3D Environments
作者: Ryuki Hyodo
分类: cs.MA, cs.AI
发布日期: 2026-08-24
备注: GitHub Repositories: https://github.com/ryukih/SD-AgentFoundry-2D and https://github.com/ryukih/SD-AgentFoundry-3D
💡 一句话要点
提出最小化本地仿真基础以支持LLM和VLM驱动的智能体
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 视觉语言模型 智能体仿真 教育工具 快速原型开发 多智能体系统 数字双胞胎
📋 核心要点
- 现有的智能体仿真平台在研究和修改上存在困难,限制了其在教育和快速原型开发中的应用。
- 本文提出了SD-AgentFoundry-2D和SD-AgentFoundry-3D两个简化的仿真基础,旨在提供易于使用的环境以支持LLM和VLM的应用。
- 这两个平台能够在本地计算机上运行,支持多智能体交互和自然语言指令生成,促进了生成社会仿真的学习和扩展。
📝 摘要(中文)
大型语言模型(LLMs)和视觉语言模型(VLMs)正在扩展智能体仿真中可表示的行为范围,但许多现有平台难以在普通计算机上进行研究、修改或运行。本文提出了两个有意简化的仿真基础,旨在教育和快速原型开发。SD-AgentFoundry-2D提供了一个二维多智能体环境,允许本地托管的LLM智能体移动、交流、响应场地占用并遇到空间局部火灾事件。SD-AgentFoundry-3D则提供了一个三维数字双胞胎环境,其中本地托管的VLM接收第一人称图像并生成自然语言移动指令。这两个代码库旨在本地运行于macOS、Windows和Linux,并故意开放以便修改,而非作为完成的应用程序开发。它们共同为学习生成社会仿真和构建特定领域扩展提供了可访问的起点。
🔬 方法详解
问题定义:本文旨在解决现有智能体仿真平台在普通计算机上难以研究和修改的问题,限制了教育和原型开发的灵活性。
核心思路:论文提出了两个简化的仿真基础,SD-AgentFoundry-2D和SD-AgentFoundry-3D,分别用于二维和三维环境,支持LLM和VLM的本地托管,旨在提供易于使用的学习工具。
技术框架:SD-AgentFoundry-2D包括多智能体环境,允许智能体在二维空间中移动和互动;SD-AgentFoundry-3D则是一个数字双胞胎环境,支持从第一人称视角接收图像并生成移动指令。
关键创新:最重要的创新在于这两个平台的简化设计,使得用户可以轻松修改和扩展,而不是使用复杂的现成应用程序。
关键设计:代码库支持在macOS、Windows和Linux上本地运行,设计上留有修改空间,鼓励用户进行个性化开发。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SD-AgentFoundry-2D和SD-AgentFoundry-3D在本地计算机上运行流畅,支持多智能体交互和自然语言指令生成,显著提升了用户在生成社会仿真中的学习效率和开发灵活性。
🎯 应用场景
该研究的潜在应用领域包括教育、游戏开发、机器人控制和智能体系统的研究。通过提供易于使用的仿真基础,研究者和开发者可以快速原型化和测试新想法,推动智能体技术的进步和应用。
📄 摘要(原文)
Large language models (LLMs) and vision-language models (VLMs) are expanding the range of behaviors that can be represented in agent-based simulations, but many contemporary platforms are difficult to study, modify, or run on ordinary computers. We present two intentionally minimal simulation foundations for education and rapid prototyping. SD-AgentFoundry-2D provides a two-dimensional multi-agent environment in which locally hosted LLM agents move, communicate, respond to place occupancy, and encounter spatially localized fire events. SD-AgentFoundry-3D provides a three-dimensional digital-twin environment in which a locally hosted VLM receives first-person images and produces natural-language movement instructions. Both codebases are designed to run locally on macOS, Windows, and Linux and are deliberately left open to modification rather than developed as finished applications. Together, they offer accessible starting points for learning about generative social simulation and for building domain-specific extensions.