Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion
作者: Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin
分类: cs.CV
发布日期: 2026-07-28
💡 一句话要点
提出多模态模块以提升食品图像分割性能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 食品图像分割 多模态融合 大型语言模型 深度学习 营养追踪
📋 核心要点
- 现有食品图像分割模型在处理视觉相似成分和稀有食品类别时表现不佳,影响了其在健康应用中的有效性。
- 本文提出了两个多模态模块LIM-F和LIM-Q,利用大型语言模型推断的成分标签,直接注入语义信息以提升分割性能。
- 在FoodSeg103基准测试中,所提方法达到了最先进的性能,LIM-Q与Swin-L结合时mIoU为55.0,LIM-F也表现出色,mIoU为54.4。
📝 摘要(中文)
食品图像分割在营养追踪和个性化健康监测等健康相关应用中至关重要。然而,现有模型在视觉相似的成分和稀有食品类别上表现不佳。为了解决这一问题,本文提出了两个可插拔的多模态模块,通过利用大型语言模型(LLMs)推断的成分标签来增强分割性能。第一个模块LIM-F与任何生成多层输出的图像编码器配对,第二个模块LIM-Q则针对Mask2Former风格的Transformer解码器。通过直接将语义成分信息注入视觉分析流程,避免了图像与文本的预对齐需求。在FoodSeg103基准上,所提方法达到了最先进的性能,LIM-Q与Swin-L图像编码器结合时,平均交并比(mIoU)达到55.0,LIM-F在同一模型下也表现出强大的泛化能力,mIoU为54.4。此外,该方法在CNN架构中也表现出色,mIoU从47.7提升至49.8,且训练时GPU内存消耗仅增加3.8GB,提供了一个实用且可扩展的细粒度食品理解解决方案。
🔬 方法详解
问题定义:本文旨在解决食品图像分割中对视觉相似成分和稀有食品类别的低效处理问题。现有方法在这些情况下的表现往往不尽如人意,影响了其在实际应用中的有效性。
核心思路:论文提出的核心思路是通过两个多模态模块(LIM-F和LIM-Q)来增强分割模型的性能。这些模块利用大型语言模型推断的成分标签,将语义信息直接注入视觉分析流程,从而提升模型对复杂食品图像的理解能力。
技术框架:整体架构包括两个主要模块:LIM-F与图像编码器(如Swin Transformer)配对,处理多层输出;LIM-Q则与Mask2Former风格的解码器结合,优化查询过程。这样的设计使得模型能够在不需要预对齐图像与文本的情况下,直接利用成分信息进行训练。
关键创新:最重要的技术创新在于提出了LIM-F和LIM-Q两个模块,能够有效地将语言信息与视觉信息融合,显著提升了分割精度。这一方法与传统的图像-文本对齐方法本质上不同,提供了一种更灵活的解决方案。
关键设计:在参数设置上,模型训练时GPU内存消耗仅增加至3.8GB,显示出其高效性。此外,LIM-F和LIM-Q的设计允许与多种编码器和解码器架构兼容,增强了方法的通用性和适用性。通过这些设计,模型在不同架构下均表现出色。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在FoodSeg103基准上达到了最先进的性能,LIM-Q与Swin-L结合时的mIoU为55.0,LIM-F在同一模型下的mIoU为54.4。此外,LIM-F在CNN架构中也实现了从47.7到49.8的提升,展示了其强大的泛化能力和适用性。
🎯 应用场景
该研究的潜在应用领域包括营养追踪、个性化健康监测以及食品识别等。通过提升食品图像分割的准确性,能够为用户提供更精准的营养信息,促进健康管理。同时,该方法的可扩展性使其在不同的视觉任务中具有广泛的应用前景,未来可能推动食品科技和健康科技的进一步发展。
📄 摘要(原文)
Food image segmentation plays a vital role in health-related applications such as nutrition tracking and personalized health monitoring. However, existing models often underperform on visually similar ingredients and rare food categories. To address this issue, we propose two plug-and-play multimodal modules that enhance the segmentation performance by leveraging ingredient labels inferred from food images using large language models (LLMs). The first module, called LIM-F (Language Injection Module for Features), is designed to pair with any image encoder that produces multi-layer outputs (e.g., Swin Transformer), while the second module, LIM-Q (Language Injection Module for Queries), targets Mask2Former-style Transformer-based decoders. Both modules enable training without the need for pre-aligning images with text by directly injecting semantic ingredient information into the visual analysis pipeline. On the FoodSeg103 benchmark, the proposed method achieves state-of-the-art performance. Specifically, integrating LIM-Q into the Mask2Former decoder with a Swin-L image encoder yields a mean Intersection over Union (mIoU) of 55.0. LIM-F also demonstrates strong generalization and competitive performance, reaching an mIoU of 54.4 under the same model (Swin-L+Mask2Former). Furthermore, its applicability extends beyond Transformer-based decoders, as evidenced by an improvement from 47.7 to 49.8 mIoU when integrated into a CNN-based architecture. Notably, the improved segmentation accuracy is achieved with only a moderate (at most 3.8 GB) increase in the GPU memory consumption during training. Thus, the proposed approach offers a practical and scalable solution for fine-grained food understanding.