Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy
作者: Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai
分类: cs.RO, cs.AI
发布日期: 2026-08-10
备注: 7 pages. Not yet finalized for conference submission
💡 一句话要点
提出LLM驱动的验证层以提升机器人自主性安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 机器人自主性 LLM驱动 验证层 安全性评估 对抗性攻击 规划模型 伦理合规 多模型集成
📋 核心要点
- 现有机器人自主系统多集中于执行而非验证,导致潜在的安全隐患和伦理问题。
- 提出LLM驱动的验证层,作为规划与执行之间的中间件,评估行动的许可性。
- 实验显示该系统在接受、升级和拒绝类别中达到了近85%的精度,且对抗性攻击的防控率高达97%。
📝 摘要(中文)
随着人工智能工具的进步,机器人自主性研究逐渐兴起,但现有系统多集中于执行而非验证规划模型的可行性。类似于通用的LLM,机器人规划模型存在风险:可能偏向用户指定的目标,建议与科学伦理不符的行动,或因无法“记忆”先前的安全风险而导致不安全,甚至可能受到对自主生态系统的对抗性攻击。为此,本文提出了一种LLM驱动的验证层,旨在评估行动的许可性。该层通过结合多模型的思维链推理,形成一个专家法官的集成,作为中间件,控制从规划模块到机器人低级控制的计划流转。实验结果显示,该系统在接受、升级和拒绝类别中达到了近85%的精度,并实现了97%的对抗性攻击防控,接受和拒绝任务之间的错误率极低。
🔬 方法详解
问题定义:本文旨在解决机器人自主系统在执行阶段缺乏有效验证的问题。现有方法往往忽视了对规划模型可行性的验证,导致潜在的安全隐患和伦理风险。
核心思路:论文提出了一种LLM驱动的验证层,作为规划与执行之间的中间件,利用LLM进行行动许可性评估,从而确保机器人在执行任务时的安全性和伦理性。
技术框架:整体架构包括三个主要模块:规划模块、LLM验证层和执行模块。规划模块生成初步计划,LLM验证层评估计划的可行性,执行模块负责实际执行经过验证的计划。
关键创新:最重要的创新在于引入了LLM作为“法官”,通过多模型的思维链推理,结合专家输出,形成一种混合专家和自一致性的方法。这种设计有效提升了计划的安全性和伦理合规性。
关键设计:在设计中,采用了多模型集成的方式,确保不同模型的输出能够相互验证。此外,系统在接受、拒绝和升级决策的边界上进行了精细调控,以降低错误率。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的LLM驱动验证层在接受、升级和拒绝类别中达到了近85%的精度,且对抗性攻击的防控率高达97%。在接受和拒绝任务之间的错误率极低,主要错误发生在升级决策的边界上,表明系统在决策过程中的高效性和准确性。
🎯 应用场景
该研究的潜在应用领域包括自主机器人、无人驾驶汽车和智能制造等。通过引入LLM驱动的验证层,可以显著提升这些系统在复杂环境中的安全性和可靠性,确保其在执行任务时遵循伦理规范,减少事故发生的可能性。未来,该技术有望在更广泛的自主系统中得到应用,推动智能技术的安全发展。
📄 摘要(原文)
Advances in advanced artificial intelligence tools have sparked research in robot autonomy, but the development of such systems has largely focused on execution rather than verifying the feasibility actions planning models propose. Like general-purpose LLMs, robotics planning models carry risks: biased toward user-specified goals, they may suggest actions misaligned with scientific ethics, they may be unsafe due to an inability to "remember" prior safety risks, or they may be vulnerable to adversarial attacks on the autonomy ecosystem. We propose a LLM-driven verification layer between planning and execution to evaluate action permissibility. Our LLM-as-a-Judge ensemble combines chain-of-thought reasoning across models and synthesizes those expert judge outputs, mirroring a combination of a mixture of experts and self-consistency approach. This layer serves as middleware, gating plans from the server's planning module before they reach the MCP server and therefore the robot's low-level controls: plans are approved, rejected for reformulation, or escalated for human review. With this system, we achieve near 85% precision across accept/escalate/reject categories 97% containment of adversarial attacks, with negligible errors between accepting and rejecting tasks, and errors mostly manifesting at the escalate boundary.