Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

📄 arXiv: 2608.14152v1 📥 PDF

作者: Sheng Hong, Xuanqi Wang, Jiacheng Wang, Yuwei Wang

分类: cs.AI

发布日期: 2026-08-14


💡 一句话要点

提出多模态核心观点提取框架以解决信息过载问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态融合 观点提取 科学技术情报 量化低秩适应 视觉证据 多语言处理 模糊累积前景理论 结构化输出

📋 核心要点

  1. 现有模型在多语言和多模态环境中对信息流的噪声过滤能力不足,导致观点提取的准确性和可靠性受到影响。
  2. 本文提出了一种多模态核心观点提取框架,利用视觉证据作为文本判断的上下文锚点,以提高提取效果。
  3. 微调后的模型在多语言设置下显著提高了F1分数,尤其在西班牙语和俄语上,分别提升至46.05%和51.93%。

📝 摘要(中文)

近年来,大型语言模型的进步重塑了语义分析。科学技术情报中的观点提取需要从大量信息流中提取简洁的核心观点。现有模型在多语言和多模态环境中对噪声的过滤能力有限,结构化输出的可靠性不足。为了解决信息过载和提取偏差,本文提出了一种多模态核心观点提取框架,其中视觉证据作为文本判断的上下文锚点。基于VideoLLaMA2和VideoLLaMA2.1模型,采用量化低秩适应(QLoRA)对2194个多语言和多模态样本进行微调。在选定的图像增强设置下,微调后的VL2.1生成结构化的JSON核心观点输出,精度达到64.98%,召回率为42.15%,F1分数为51.14%,样本级准确率为74.00%。相较于零样本设置,西班牙语和俄语的F1分数分别提高至46.05%和51.93%。该框架还结合了基于模糊累积前景理论的后提取分流模块,为下游STI筛选提供案例级价值信号。

🔬 方法详解

问题定义:本文旨在解决科学技术情报中的观点提取问题,现有方法在多语言和多模态环境中对噪声的过滤能力不足,导致提取结果的准确性和可靠性较低。

核心思路:提出的框架通过将视觉证据作为文本判断的上下文锚点,帮助模型更好地理解和提取核心观点,从而应对信息过载和提取偏差的问题。

技术框架:整体架构包括数据预处理、模型微调和后处理模块。首先对2194个多语言和多模态样本进行整理,然后使用VideoLLaMA2和VideoLLaMA2.1作为基础模型进行QLoRA微调,最后通过模糊累积前景理论进行案例级价值评估。

关键创新:最重要的创新在于将视觉信息与文本信息结合,利用视觉证据增强文本判断的上下文理解能力,这一设计显著提升了多模态环境下的观点提取效果。

关键设计:在微调过程中,采用了量化低秩适应(QLoRA)技术,设置了特定的损失函数以优化模型性能,并在图像增强设置下生成结构化的JSON输出,确保提取结果的可用性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,微调后的VL2.1模型在多语言环境下的F1分数显著提升,西班牙语和俄语的F1分数分别从4.83%和0.45%提高至46.05%和51.93%。整体精度达到64.98%,召回率为42.15%,样本级准确率为74.00%,展示了该框架在观点提取任务中的有效性。

🎯 应用场景

该研究的潜在应用领域包括科学技术情报分析、社交媒体舆情监测和多模态信息检索等。通过高效提取核心观点,能够帮助决策者快速获取关键信息,提升信息处理的效率和准确性,未来可能对相关领域产生深远影响。

📄 摘要(原文)

Recent advances in large language models (LLMs) have reshaped semantic analysis. Opinion Extraction (OE) for Science and Technology Intelligence (STI) requires concise core opinions from large information streams. Off-the-shelf models struggle to filter noise from these streams and show limited structured-output reliability in zero-shot multilingual and multi-modal settings. To address information overload and extraction defocus, this study proposes a multimodal core-opinion extraction framework in which visual evidence serves as a contextual anchor for textual judgment. Using VideoLLaMA2 (VL2) and VideoLLaMA2.1 (VL2.1) as the base models, we apply Quantized Low-Rank Adaptation (QLoRA) fine-tuning on a curated dataset of 2,194 multilingual and multimodal samples. Under the selected Image-Augmented setting, fine-tuned VL2.1 generates structured JSON core-opinion outputs, achieving 64.98% Precision, 42.15% Recall, 51.14% F1-score, and 74.00% sample-level accuracy. Relative to the zero-shot VL2.1 setting, it raises the F1-scores of Spanish and Russian from 4.83% and 0.45% to 46.05% and 51.93%, respectively. The framework further incorporates a Fuzzy Cumulative Prospect Theory-based post-extraction triage module for case-level value assessment, providing a case-level value signal for downstream STI screening.