LLM-Only PDDL Domain Repair with Open-Weight Models

📄 arXiv: 2608.17341v1 📥 PDF

作者: Nader Karimi Bavandpour, Pascal Bercher

分类: cs.AI

发布日期: 2026-08-18


💡 一句话要点

提出LLM仅基于PDDL模型修复的方法以解决自动化规划问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自动化规划 PDDL模型 大型语言模型 模型修复 推理能力

📋 核心要点

  1. 现有方法在自动化规划中对PDDL模型的错误检测和修复能力不足,导致修复结果不可靠。
  2. 本文提出了一种基于大型语言模型的修复方法,利用LLM的推理能力来自动修复PDDL模型中的错误。
  3. 实验结果表明,LLM在修复任务中表现优异,F1分数提升至0.87,但在某些领域的测试通过率仍然较低。

📝 摘要(中文)

人工智能规划关注于寻找实现特定目标的动作序列,通常依赖于规划领域定义语言(PDDL)来表示世界模型。当前研究探讨如何检测和修复这些模型中的错误。用户可以提供正向测试计划和执行失败的负向测试计划,自动修复方法则修改PDDL模型以满足这些约束。本文评估了近期开放权重的大型语言模型在执行此修复任务时的能力,实验结果显示,符号基线的F1分数为0.49,而最佳LLM达到0.87,绝对提升0.38。然而,该设置的平均测试通过率仅为0.82,在Thoughtful领域下降至0.06,甚至最佳设置的测试跟踪也仅达到0.92。因此,当前的开放权重模型无法保证满足可靠的自动化模型修复所需的测试约束。

🔬 方法详解

问题定义:本文旨在解决自动化规划中PDDL模型错误的检测与修复问题。现有方法在处理模型错误时,往往无法保证修复结果的可靠性,尤其是在复杂领域中。

核心思路:论文的核心思路是利用开放权重的大型语言模型(LLM)进行PDDL模型的自动修复。通过LLM的强大推理能力,能够更有效地识别和修复模型中的错误,从而提高修复的准确性。

技术框架:整体架构包括数据输入、模型推理和结果输出三个主要模块。首先,用户提供正向和负向测试计划作为输入,LLM进行推理并生成修复后的PDDL模型,最后输出修复结果并进行验证。

关键创新:最重要的技术创新在于将LLM应用于PDDL模型的修复任务,利用其开放权重特性,显著提升了修复效果,与传统符号方法相比,LLM在推理能力和灵活性上具有本质区别。

关键设计:在实验中,采用了多种参数设置和损失函数,以优化LLM的推理过程。具体的网络结构和训练策略未在摘要中详细说明,需进一步查阅原文以获取更多技术细节。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,符号基线的F1分数为0.49,而最佳LLM的F1分数达到了0.87,绝对提升幅度为0.38。然而,尽管LLM表现出色,其在Thoughtful领域的测试通过率仅为0.06,显示出当前模型在某些复杂领域的局限性。

🎯 应用场景

该研究的潜在应用领域包括自动化规划、机器人控制和智能系统设计等。通过提高PDDL模型的修复能力,可以显著提升智能系统在复杂环境中的决策和执行能力,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

AI planning is concerned with finding a sequence of actions that achieves a specified goal. It relies on explicit models of the world, commonly represented in the Planning Domain Definition Language (PDDL). An active line of research investigates how errors in such models can be detected and repaired. For example, users may provide positive test plans that are solutions, and negative test plans that fail during execution. Automated repair methods then modify the PDDL model to satisfy these constraints. In this paper, we evaluate the ability of recent open-weight large language models to perform this repair task using an LLM-only approach. Our experiments show that the symbolic baseline achieves an $F_1$ score of $.49$, while the best-performing LLM reaches $.87$ with high reasoning effort, an absolute improvement of $.38$. However, that setting has a mean test pass rate of only $.82$, falling to $.06$ on the Thoughtful domain; even the best setting that includes the test traces reaches only $.92$. Thus, current open-weight models cannot guarantee satisfaction of the test constraints required for reliable automated model repair.