FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
作者: Mohamed Basem, Vincent Christlein
分类: cs.CV, cs.LG
发布日期: 2026-08-03
备注: 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task
💡 一句话要点
提出多模态推理系统以解决视觉问答任务
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态推理 视觉问答 模型评分 图像增强 后处理技术
📋 核心要点
- 现有方法在处理多语言教育和科学图像时,往往面临推理不可靠和输出格式不一致的问题。
- 论文提出通过直接候选标签评分和后处理技术,增强视觉问答系统的稳健性和准确性。
- 在实验中,系统在视觉多项选择问答中取得0.7108的准确率,视觉开放问答中多个指标均表现优异,显示出显著的提升。
📝 摘要(中文)
本文介绍了我们在ImageCLEF 2026多模态推理系统中的应用,针对视觉多项选择问答(Visual MCQ)和视觉开放问答(Visual OpenQA)子任务。该挑战要求对多语言教育和科学图像进行可靠推理,图像中包含密集文本、图表、表格、公式和单位,同时要求严格的答案格式。我们的核心发现是,稳健的输出控制与模型选择同样重要。对于视觉多项选择问答,我们用直接候选标签评分替代脆弱的自由形式生成,并通过得分融合和投票结合互补的结果。对于视觉开放问答,我们采用图像增强、简洁的最终答案提示、确定性解码和针对性的后处理,以去除推理痕迹和格式化伪影。在没有特定任务模型训练的情况下,我们的官方提交在视觉多项选择问答中获得了第三名,准确率为0.7108,在视觉开放问答中获得了第一名,COMET为0.6488,BLEU为0.1391,ROUGE L为0.2762,METEOR为0.2383。这些结果突显了推理工程的实际价值:细致的评分、集成、提示和清理可以将强大的视觉语言模型转变为可靠的竞争系统。
🔬 方法详解
问题定义:本文旨在解决视觉多项选择问答和视觉开放问答中的推理不可靠和输出格式问题。现有方法常依赖脆弱的自由形式生成,导致结果不稳定。
核心思路:我们通过直接从视觉语言模型的logits中评分候选标签,替代传统生成方法,确保输出的稳健性。同时,采用图像增强和后处理技术,提升最终答案的准确性和格式一致性。
技术框架:整体架构包括数据预处理、模型推理、候选评分、结果融合和后处理五个主要模块。首先对输入图像进行增强,然后通过视觉语言模型进行推理,接着对候选答案进行评分,最后通过融合和清理步骤生成最终输出。
关键创新:最重要的创新在于将候选标签评分与后处理结合,形成了一种新的推理工程方法。这种方法与传统的生成式模型有本质区别,强调了输出控制的重要性。
关键设计:在模型设计中,我们采用了确定性解码策略,避免了随机性带来的不确定性。同时,后处理阶段针对性地去除了推理痕迹和格式化伪影,确保输出的整洁性。实验中没有进行特定任务的模型训练,依然取得了优异的成绩。
🖼️ 关键图片
📊 实验亮点
在实验中,我们的系统在视觉多项选择问答中获得了0.7108的准确率,排名第三;在视觉开放问答中,多个指标如COMET、BLEU、ROUGE L和METEOR分别达到了0.6488、0.1391、0.2762和0.2383,显示出显著的性能提升,充分验证了推理工程的有效性。
🎯 应用场景
该研究的潜在应用领域包括教育、科学研究和信息检索等。通过提升视觉问答系统的准确性和可靠性,可以更好地支持多语言环境下的知识获取和学习,促进跨文化交流与合作。未来,该技术有望在智能教育平台和自动化信息服务中发挥重要作用。
📄 摘要(原文)
We present our ImageCLEF 2026 Multimodal Reasoning system for the Visual Multiple Choice Question Answering (Visual MCQ) and Visual Open Question Answering (Visual OpenQA) subtasks. The challenge requires reliable reasoning over multilingual educational and scientific images with dense text, diagrams, charts, tables, formulas, and units, while enforcing strict answer formats. Our central finding is that robust output control is as important as model choice. For Visual MCQ, we replace fragile free-form generation with direct candidate label scoring from vision-language model logits, then combine complementary runs through score fusion and voting. For Visual OpenQA, we use image enhancement, concise final answer prompting, deterministic decoding, and targeted post-processing to remove reasoning traces and formatting artifacts. Without task-specific model training, our official submissions achieved third place in Visual MCQ with 0.7108 accuracy and first place in Visual OpenQA with 0.6488 COMET, 0.1391 BLEU, 0.2762 ROUGE L, and 0.2383 METEOR. The results highlight the practical value of inference engineering: careful scoring, ensembling, prompting, and cleanup can turn strong VLMs into reliable competition systems.