InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models

📄 arXiv: 2609.04014v1 📥 PDF

作者: Chao Shen, Xinyuan Li, Yunfan Zhou, Jianguo Yao, Haibing Guan, Zhihai Wang, Xijun Li

分类: cs.AI

发布日期: 2026-09-03


💡 一句话要点

提出InSituMeasure以解决工业场景中的测量基础问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大型语言模型 工业测量 数据集构建 故障诊断 真实场景评估

📋 核心要点

  1. 现有的多模态大型语言模型在连续值测量中表现不佳,缺乏真实情境和专业知识的支持。
  2. 论文提出InSituMeasure数据集,包含真实工业场景和详细的测量属性注释,以评估模型在实际应用中的表现。
  3. 实验结果显示,最好的模型在联合值-单位准确率上仅为25.7%,表明当前技术在工业测量中的局限性。

📝 摘要(中文)

对于训练有素的操作员来说,测量仪表的读数需要较少的专业知识、低认知负担和高重复性。然而,尽管多模态大型语言模型(MLLMs)在一般多模态基准上表现良好,但在连续值测量方面仍然不可靠。现有基准测试暴露了这一弱点,但将测量与现实知识背景隔离,缺乏真实的情境、专业仪器、现实噪声和匹配的诊断注释,降低了现实感并限制了根本原因分析。我们提出InSituMeasure来评估情境测量的基础。该数据集包含2922个真实工业监测场景,涵盖八个功能类别的专业工程仪器,具有密集的仪表属性注释和故障诊断噪声标签。我们定义了在预定义公差和单位一致性下的数值准确性度量,以及对虚假或无法回答任务的拒绝和模型失败与注释错误因素之间的对齐。经过24个最先进的MLLMs测试,最佳模型仅达到25.7%的联合值-单位准确率和51.8%的信心-诊断F1,揭示了通用多模态能力与可靠情境测量之间的显著差距。

🔬 方法详解

问题定义:论文要解决的问题是现有多模态大型语言模型在工业测量中的不可靠性,尤其是在连续值测量方面的不足。现有方法在真实情境下缺乏有效性,无法处理复杂的工业噪声和多样化的测量工具。

核心思路:论文的核心思路是构建InSituMeasure数据集,通过提供真实的工业监测场景和详细的注释,来评估和提升多模态语言模型在测量任务中的表现。该方法强调在复杂环境中进行测量的必要性,以提高模型的实用性和可靠性。

技术框架:整体架构包括数据集的构建、模型的训练和评估三个主要阶段。数据集包含2922个场景,涵盖多种仪器和测量任务,模型则在此基础上进行训练和测试。评估阶段则通过定义准确性和一致性指标来衡量模型表现。

关键创新:最重要的技术创新点在于引入了真实工业场景的测量基础,结合密集的注释和噪声标签,使得模型能够在更接近实际应用的环境中进行训练和评估。这与现有方法的实验室环境形成鲜明对比。

关键设计:关键设计包括对数据集的精细化注释,定义了数值准确性、单位一致性等多个评估指标。此外,模型训练中采用了针对性损失函数,以提高对噪声和复杂情境的鲁棒性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,经过24个最先进的多模态大型语言模型测试,最佳模型在联合值-单位准确率上仅达到25.7%,而信心-诊断F1分数为51.8%。这些结果揭示了当前技术在工业测量任务中的显著不足,强调了进一步研究的必要性。

🎯 应用场景

该研究的潜在应用领域包括工业自动化、智能制造和设备监控等。通过提升多模态语言模型在实际测量中的可靠性,能够有效支持工业现场的实时决策和故障诊断,具有重要的实际价值和未来影响。

📄 摘要(原文)

For trained operators, gauge reading requires little specialized knowledge, low cognitive effort, and high repeatability. Yet Multimodal Large Language Models (MLLMs) remain unreliable in continuous-valued measurement despite strong results on general multimodal benchmarks. Existing benchmarks expose this weakness but isolate measurement from realistic, knowledge-grounded settings, with limited situated context, specialized instruments, real-world noise, and matched diagnostic annotations, reducing realism and constraining root-cause analysis. We introduce InSituMeasure to evaluate situated measurement grounding. It contains 2,922 real industrial monitoring scenes across eight functional categories of professional engineering instruments, with dense gauge-attribute annotations and noise tags for failure diagnosis. We define metrics for numerical accuracy under predefined tolerances and unit consistency, rejection of fake or unanswerable tasks, and alignment between model failures and annotated error factors. Across 24 state-of-the-art MLLMs, the best model reaches only 25.7\% joint value-unit accuracy and 51.8\% confidence-diagnosis F1, revealing a substantial gap between general multimodal competence and reliable situated measurement. Further analysis identifies failures from text-induced shortcuts, overconfident responses, and authentic industrial noise, including mixed disturbances, viewpoint deviation, occlusion, and environmental interference.