Towards Generalizable Visually Grounded Exploration of Household Devices

📄 arXiv: 2609.00845v1 📥 PDF

作者: Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo

分类: cs.AI

发布日期: 2026-09-01

备注: Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026


💡 一句话要点

提出VGEBench以解决家用设备的通用视觉基础探索问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视觉语言模型 具身探索 智能家居 动态交互 状态跟踪 反馈修正 通用性 机器人技术

📋 核心要点

  1. 现有的具身探索方法过于依赖人工标注的轨迹,导致智能体的泛化能力不足。
  2. 论文提出VGEBench基准,通过逻辑驱动状态机框架模拟多轮交互,提升智能体的视觉基础探索能力。
  3. 实验结果显示,现有VLMs在将语义知识转化为实际操作时存在显著困难,且状态跟踪能力不足。

📝 摘要(中文)

近年来,视觉语言模型(VLMs)在静态视觉识别和高级语义推理方面取得了显著进展。然而,现有的具身探索范式仍然严重依赖于从人工标注轨迹中进行模仿学习,这限制了智能体的泛化能力。实现通用自主具身智能体的关键瓶颈在于通用视觉基础探索,即在没有手册或特定训练的情况下,能够操作新设备并将抽象世界知识有效地与细粒度视觉可用性结合。然而,现有基准未能评估这一能力,通常依赖于显式文档和标注轨迹,忽视了功能设备操作所必需的动态假设-交互-精炼过程。为此,我们提出了VGEBench,这是一个综合基准,旨在评估VLMs的通用视觉基础探索能力。与静态数据集不同,我们构建了一个逻辑驱动状态机框架,模拟多轮交互循环,迫使智能体通过主动视觉感知和反馈驱动的修正来实现目标。实验结果表明,现有的VLMs在将语义知识转化为物理执行和维持长时间状态跟踪方面面临重大挑战。

🔬 方法详解

问题定义:本论文旨在解决智能体在没有手册或特定训练的情况下,如何通用地操作新家用设备的问题。现有方法主要依赖于人工标注轨迹,导致智能体在面对新环境时的泛化能力不足。

核心思路:论文提出的核心思路是构建VGEBench基准,通过逻辑驱动状态机框架来模拟多轮交互,促使智能体在动态环境中通过视觉感知和反馈进行有效的探索与学习。

技术框架:整体架构包括逻辑驱动状态机、视觉感知模块和反馈修正模块。智能体在多轮交互中不断更新其状态,通过视觉信息与环境进行交互,逐步实现目标。

关键创新:最重要的技术创新在于引入了动态假设-交互-精炼过程,这一过程使得智能体能够在没有明确指导的情况下,通过自我反馈进行学习,显著提升了其在新设备操作中的能力。

关键设计:在设计中,采用了多层次的状态跟踪机制和反馈修正策略,确保智能体能够在长时间的交互中保持对环境的理解和适应能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,现有的视觉语言模型在VGEBench基准上表现不佳,尤其是在将语义知识转化为物理执行方面,准确率低于50%。与传统方法相比,论文提出的方法在状态跟踪和反馈修正能力上有显著提升,展示了更强的适应性和智能性。

🎯 应用场景

该研究的潜在应用领域包括智能家居、机器人助手和自动化设备操作等。通过提升智能体的通用视觉基础探索能力,可以实现更智能的家用设备管理和人机交互,未来可能对家庭自动化和智能生活方式产生深远影响。

📄 摘要(原文)

Recent advancements in Vision-Language Models (VLMs) have demonstrated impressive capabilities in static visual recognition and high-level semantic reasoning. However, current embodied exploration paradigms still heavily rely on imitation learning from human-annotated trajectories, which severely limits agents' generalization ability. The key bottleneck of realizing general autonomous embodied agents lies in Generalizable Visually Grounded Exploration: the ability to operate novel devices without manuals or specific training by actively grounding abstract world knowledge into fine-grained visual affordances. Yet, existing benchmarks fail to evaluate this capability: they generally rely on explicit documents and annotated trajectories, neglecting the dynamic Hypothesis-Interaction-Refinement process essential for functional device operation. To bridge this gap, we introduce VGEBench, a comprehensive benchmark designed to evaluate the generalizable visually grounded exploration capabilities of VLMs. Unlike static datasets, we construct a Logic-Driven State Machine framework. This framework simulates multi-turn interaction loops, compelling agents to achieve goals by active visual perception and feedback-driven correction. Experimental results demonstrate that existing VLMs face significant challenges in translating semantic knowledge into physical execution and maintaining long-horizon state tracking.