MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
作者: Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
分类: cs.AI, cs.CV
发布日期: 2026-08-31
💡 一句话要点
提出MNIST-PRO以解决部分可观察环境中的感知问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 部分可观察环境 感知状态构建 多模态模型 MNIST基准 AI代理 记忆表示 视觉证据整合
📋 核心要点
- 现有基准难以有效评估AI代理在部分可观察环境中的感知状态构建与解释能力,存在物理和控制复杂性。
- 本文提出MNIST-PRO基准,通过将数字识别任务转化为顺序性搜索任务,专注于代理的感知能力。
- 实验结果显示,模型在完全可观察情况下表现良好,但在部分可观察情况下存在明显性能差距,揭示了感知状态构建的挑战。
📝 摘要(中文)
在部分可观察环境中,AI代理需要协调主动感知与工作记忆,以维持不断演变的感知状态。然而,现有基准难以隔离这一感知状态的构建与解释能力,因为它们引入了物理和控制的复杂性。为此,本文提出MNIST-PRO基准,通过将MNIST数字识别转化为具有回顾约束的顺序性、基于瞬间观察的搜索任务,来隔离代理的感知能力。我们评估了十种多模态模型在四种记忆表示下的表现,包括原始视觉历史、文本状态、结构化的度量网格地图和整合的视觉画布。尽管模型在完全可观察的情况下表现优异,但在部分可观察的情况下却暴露出明显的性能差距。我们识别出三个主要瓶颈,表明仅仅获取视觉证据是不够的,代理还必须能够构建和更新可靠的感知状态。
🔬 方法详解
问题定义:本文旨在解决AI代理在部分可观察环境中感知状态构建与解释的能力不足,现有方法未能有效隔离这一能力,导致性能下降。
核心思路:通过将MNIST数字识别转化为顺序性、基于瞬间观察的搜索任务,MNIST-PRO基准能够有效评估代理在感知状态构建中的表现。这样的设计使得代理在面对不完整信息时,能够更好地进行感知整合与更新。
技术框架:MNIST-PRO的整体架构包括多个模块:首先是数据输入模块,负责处理MNIST数据;其次是感知模块,代理通过瞬间观察获取信息;最后是记忆模块,代理在此基础上构建和更新其感知状态。
关键创新:MNIST-PRO的最大创新在于将传统的数字识别任务转化为具有回顾约束的搜索任务,从而有效隔离了感知能力的评估。这一方法与现有基准的根本区别在于其简化了环境复杂性,使得感知状态的构建与解释成为焦点。
关键设计:在模型设计上,本文使用了四种不同的记忆表示,包括原始视觉历史、文本状态、结构化度量网格地图和整合视觉画布。每种表示都有其特定的参数设置和损失函数,以优化代理的感知能力。
🖼️ 关键图片
📊 实验亮点
实验结果表明,尽管模型在完全可观察情况下表现良好,但在部分可观察情况下,性能差距明显,尤其在感知状态构建和更新方面。具体而言,代理在面对不完整信息时,表现出明显的探索不足和信念修正能力不足,揭示了当前模型的局限性。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动驾驶、智能监控等,能够帮助AI代理在复杂环境中更有效地进行感知与决策。通过提升代理的感知状态构建能力,未来可在更多实际场景中实现更高效的智能行为。
📄 摘要(原文)
AI agents in partially observable environments need to coordinate active sensing with working memory to maintain an evolving perceptual state. However, existing benchmarks struggle to isolate this perceptual-state construction and interpretation capability because they introduce physical and control complexities. We address this with MNIST-PRO, a benchmark that isolates agentic perception by converting MNIST digit recognition into a sequential, glimpse-based search task with lookback constraints. We evaluate ten multimodal models across four memory representations, including raw visual history, textual states, structured metric grid maps, and a consolidated visual canvas. While models excel under full observability, partial observability exposes a clear performance gap. We identify three distinct bottlenecks. First, perceptual-state construction and interpretation present a challenge, as agents struggle to integrate fragmented glimpses. Second, agents often stop exploring before they see the full sequence. Third, models often fail to revise early, incorrect beliefs even when faced with subsequent contradictory evidence. These results show that simply acquiring visual evidence is not enough. Agents must also be able to build and update a reliable perceptual state.