Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

📄 arXiv: 2608.22963v1 📥 PDF

作者: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

分类: cs.AI, cs.CL

发布日期: 2026-08-24

备注: 14 pages, 2 figures, 4 tables


💡 一句话要点

提出SPARE框架以解决多模态大语言模型的文本冗余问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 文本剪枝 视觉证据 Kullback-Leibler散度 任务状态摘要 自监督学习 推理优化

📋 核心要点

  1. 现有多模态大语言模型在推理过程中会产生大量冗余文本,导致视觉证据被抑制,形成文本债务。
  2. 本文提出SPARE框架,通过KL引导的剪枝方法,有效去除冗余文本,同时保留重要的视觉证据。
  3. 在多步骤视觉工具使用基准上,SPARE实现了最高的平均准确率,且去除的推理标记比例达到37.89%至64.58%。

📝 摘要(中文)

多模态大语言模型(MLLMs)在作为多步骤代理时,显式推理支持任务分解和工具协调,但也会累积自生成文本,导致文本债务的产生。随着推理的冗余,任务相关的视觉证据可能被抑制。为了解决这一问题,本文提出了SPARE框架,通过Kullback-Leibler(KL)引导的剪枝方法,去除冗余文本而不丢失视觉证据。SPARE利用紧凑的任务状态摘要作为特权诊断上下文,并通过反向KL散度测试摘要是否足够覆盖候选段落。实验结果表明,SPARE在多步骤视觉工具使用基准中实现了最高的平均准确率,同时去除了37.89%至64.58%的推理标记,恢复了对视觉证据的依赖。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在推理过程中产生的文本冗余问题,现有方法未能有效去除冗余文本,导致视觉证据被抑制。

核心思路:SPARE框架通过Kullback-Leibler引导的剪枝方法,利用紧凑的任务状态摘要作为上下文,去除冗余推理文本而不影响视觉信息的保留。

技术框架:SPARE的整体架构包括任务状态摘要生成、候选段落的上下文重放以及反向KL散度测试三个主要模块。首先生成任务状态摘要,然后在原始和摘要条件下重放模型,最后通过反向KL散度评估摘要的有效性。

关键创新:SPARE的主要创新在于使用反向KL散度来评估摘要对候选段落的覆盖程度,这一方法与传统的剪枝方法有本质区别,能够更好地保留视觉证据。

关键设计:在设计中,SPARE采用了监督微调(SFT)来优化摘要生成,确保生成的摘要更加紧凑且覆盖面广,同时设置了适当的损失函数以平衡文本剪枝与信息保留的关系。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

SPARE在多步骤视觉工具使用基准上表现出色,达到了最高的平均准确率,同时成功去除了37.89%至64.58%的推理标记,显示出良好的准确性与上下文的平衡,恢复了对视觉证据的依赖。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化工具和多模态交互系统,能够提高这些系统在处理复杂任务时的效率和准确性。未来,SPARE框架可能推动更高效的多模态学习和推理技术的发展,促进人机交互的智能化。

📄 摘要(原文)

Multimodal Large Language Models (MLLMs) are increasingly deployed as multi-step agents, where explicit reasoning supports task decomposition and tool coordination but also accumulates self-generated text. Over long trajectories, this text can dominate the context and suppress visual evidence, creating textual debt. We observe that reasoning becomes redundant once task-relevant visual evidence is grounded, while stale hypotheses can misguide later inference when grounding remains uncertain. Pruning must therefore remove redundant text without discarding visual evidence. We propose SPARE, a Kullback--Leibler (KL)-guided framework for pruning accumulated reasoning in multimodal tool-use agents. SPARE uses a compact task-state summary as privileged diagnostic context. For each candidate segment, it replays the same model under the original and summary-conditioned contexts. Reverse-KL divergence from on-policy self-distillation (OPSD) then tests whether the summary sufficiently covers the segment without disrupting future reasoning. We further fine-tune the summarizer with supervised fine-tuning (SFT), enabling more compact summaries, broader coverage, and more aggressive pruning. Across multi-step visual tool-use benchmarks, SPARE achieves the highest average accuracy among pruning methods while removing 37.89--64.58\% of reasoning tokens. This favorable accuracy--context trade-off shows that reducing textual dominance restores reliance on visual evidence and mitigates over-conditioning on self-generated language.