MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware
作者: Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang
分类: cs.AI
发布日期: 2026-07-30
💡 一句话要点
提出MMLDSum-LLM以解决多模态长文档摘要中的信息遗漏问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态长文档摘要 视觉对齐 关键词感知 长距离依赖建模 信息覆盖 跨模态一致性 深度学习
📋 核心要点
- 现有多模态长文档摘要方法在长距离依赖建模中存在注意力漂移和模态间对齐不足的问题,导致信息遗漏。
- 本文提出MMLDSum-LLM,通过引入视觉对齐加权损失和关键词感知加权损失,优化长文档摘要的生成过程。
- 在MMLDSum-Bench上进行的实验显示,MMLDSum-LLM在关键信息覆盖率和跨模态一致性方面显著优于现有模型。
📝 摘要(中文)
多模态长文档是专业知识的核心载体,但关键证据在段落和模态中分布稀疏,导致摘要时容易遗漏关键信息和出现跨模态幻觉。为了解决这些问题,本文引入了MMLDSum-Bench,一个高质量的多模态长文档摘要基准,涵盖多个领域、上下文长度和视觉-文本模态分布。我们进一步提出了MMLDSum-LLM,一个可复现的两阶段训练框架,结合了视觉对齐加权损失和关键词感知加权损失,随后通过多目标奖励的GRPO进行训练。大量实验表明,我们的方法显著提高了关键信息覆盖率和跨模态一致性。
🔬 方法详解
问题定义:本文旨在解决多模态长文档摘要中由于信息稀疏分布导致的关键信息遗漏和跨模态幻觉问题。现有方法在长距离依赖建模和模态间对齐上存在不足,影响了摘要质量。
核心思路:提出MMLDSum-LLM框架,通过两阶段训练结合视觉对齐和关键词感知损失,增强模型对关键信息的捕捉能力,从而提高摘要的准确性和一致性。
技术框架:整体架构分为两个阶段:第一阶段为监督微调,使用视觉对齐加权损失和关键词感知加权损失;第二阶段为基于多目标奖励的GRPO训练,优化关键词覆盖、图像-文本对齐、ROUGE和长度控制。
关键创新:引入视觉对齐加权损失和关键词感知加权损失是本文的主要创新点,这一设计有效解决了信息遗漏和跨模态一致性问题,显著提升了摘要质量。
关键设计:在损失函数设计中,结合了多种目标,确保模型在生成摘要时能够兼顾信息覆盖和模态对齐,具体参数设置和网络结构在实验中经过多次调优以达到最佳效果。
🖼️ 关键图片
📊 实验亮点
在MMLDSum-Bench上的实验结果显示,MMLDSum-LLM在关键信息覆盖率和跨模态一致性方面相比于领先的闭源和开源模型有显著提升,具体表现为ROUGE分数提高了XX%,关键词覆盖率提升了YY%。
🎯 应用场景
该研究的潜在应用领域包括法律文书、医学文献和技术报告等专业领域的文档摘要生成。通过提高长文档摘要的质量,能够帮助专业人士更高效地获取关键信息,提升工作效率和决策能力。未来,该技术还可能扩展到其他多模态信息处理任务中。
📄 摘要(原文)
Multimodal long documents are core carriers of professional knowledge, where critical evidence is sparsely distributed across paragraphs and modalities. This easily causes key information omission and cross-modal hallucinations in summarization by multimodal LLMs. These issues stem from attention drift in long-range dependency modeling and gaps in inter-modal alignment. To address this, we introduce MMLDSum-Bench, a high-quality benchmark for multimodal long-document summarization, covering multiple domains, context-length scales, and visual-textual modality distributions. We further propose MMLDSum-LLM, a reproducible two-stage training framework that combines supervised fine-tuning with visual-alignment weighted loss and keyword-aware weighted loss, followed by GRPO with a multi-objective reward (keyword coverage, image-text alignment, ROUGE, and length control). Extensive experiments on MMLDSum-Bench, comparing against leading closed-source and open-source multimodal models under a unified evaluation protocol - including LLM-as-a-judge scoring, atomic-claim precision/recall, image-text alignment (ITA), and ROUGE - demonstrate that our approach significantly improves key-information coverage and cross-modal consistency.