Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
作者: Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani
分类: cs.CL
发布日期: 2026-08-27
备注: Interpeech 2026
💡 一句话要点
提出跨模态不稳定性基准以解决多模态模型一致性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态模型 语音助手 对比不稳定性 文化图像 跨语言处理
📋 核心要点
- 现有多模态模型在处理语音与文本的语义一致性时存在显著的不稳定性,尤其在不同语言之间。
- 本文提出了一种新的语音增强视觉对比三元组基准,旨在评估模型在不同模态和语言下的表现。
- 实验结果显示,模态和语言的变化导致了模型在三元组判断上的不一致性,尤其是语音输入时的部分失败现象更为明显。
📝 摘要(中文)
多模态基础模型在语音助手中被广泛应用,需理解口语查询并做出视觉基础的决策。然而,语音与文本、英语与阿拉伯语之间的语义等价查询是否能产生一致的判断仍不明确。本文引入了一个包含10150幅来自18个中东和北非国家的文化图像的语音增强视觉对比三元组基准,定义了对比不稳定性为模型未能解决三元组中所有语句的条件概率。通过评估最新的多模态模型,发现模态和语言的变化导致了显著的三元组级不一致性,语音放大了部分失败。我们将基准公开供社区使用。
🔬 方法详解
问题定义:本文旨在解决多模态模型在处理语音与文本时的一致性问题,现有方法未能充分捕捉模态和语言变化带来的影响,导致判断不稳定。
核心思路:通过引入语音增强的视觉对比三元组基准,评估模型在不同模态和语言下的表现,特别关注对比不稳定性,以便更好地理解模型的推理能力。
技术框架:整体架构包括数据集构建、对比三元组生成、模型评估等主要模块。数据集包含文化图像及其对应的语句,模型在文本和语音输入下进行评估。
关键创新:最重要的创新在于定义了对比不稳定性这一概念,能够更细致地分析模型在处理语音与文本时的表现差异,尤其是部分失败的情况。
关键设计:在数据集构建中,选择了来自18个国家的文化图像,并设计了支持与不支持的语句对,以确保评估的全面性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,模态和语言的变化导致三元组判断的一致性显著降低,尤其在语音输入时,部分失败的情况更为明显。具体而言,模型在语音输入下的对比不稳定性比文本输入时更为严重,显示出对比不稳定性的重要性。
🎯 应用场景
该研究的潜在应用领域包括智能语音助手、跨语言信息检索和多模态交互系统。通过提高多模态模型在不同输入条件下的一致性,能够增强用户体验和系统的可靠性,未来可能推动更智能的交互技术的发展。
📄 摘要(原文)
Multimodal foundation models are increasingly used in speech-first assistants that must interpret spoken queries and produce visually grounded decisions. Yet it remains unclear whether semantically equivalent queries yield consistent judgments across modality (text vs. speech) and language (English vs. Arabic). We introduce a speech-augmented visually grounded contrastive triplet benchmark spanning 10,150 culturally grounded images from 18 MENA countries, where each image is paired with one supported statement and two plausible but unsupported alternatives. We define contrastive instability as the conditional rate at which a model fails to resolve all statements within a triplet, isolating fragmented reasoning from complete failure. Evaluating recent multimodal models under text and speech in English and Arabic, we find that modality and language shifts introduce substantial triplet-level inconsistencies that are not fully captured by aggregate accuracy, with speech amplifying partial failures. We make the benchmark publicly available to the community.