Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference

📄 arXiv: 2608.18591v1 📥 PDF

作者: Zishan Ahmad, Vishal Vaddina

分类: cs.AI, cs.CL

发布日期: 2026-08-19


💡 一句话要点

提出BudgetDoc以优化文档推理中的推理预算分配问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文档推理 推理预算 多模态基准 模型性能 动态分配

📋 核心要点

  1. 现有方法在文档任务中均匀分配推理预算时,容易导致高成本和性能损失。
  2. 本文提出BudgetDoc基准和DRB模型,通过动态预算分配来优化推理性能。
  3. 实验结果显示,DRB在9种配置中超越了最大预算基线,同时降低了推理成本。

📝 摘要(中文)

均匀分配推理预算给大型语言模型(LLMs)既昂贵又容易导致过度思考的惩罚,尤其是在视觉布局复杂的文档任务中。为了解决这一问题,本文引入了BudgetDoc,这是第一个提供明确监督的多模态基准,旨在平衡模型、预算和性能之间的权衡。利用BudgetDoc,我们训练了DRB(文档推理平衡器),这是一个约10亿参数的预估器,能够预测不同预算水平下的模型性能,达到了0.753的加权F1分数。在动态分配推理预算的实验中,DRB在15种配置中有9种情况下的F1分数与始终使用最大预算的基线相当或更高,同时显著降低了成本。初步评估表明,DRB在跨模型选择方面具有潜在的泛化能力。

🔬 方法详解

问题定义:本文旨在解决在文档推理任务中,如何有效分配推理预算的问题。现有方法往往导致高昂的计算成本和性能损失,尤其是在复杂的视觉布局下。

核心思路:论文提出了BudgetDoc基准,结合DRB模型,通过明确的监督机制来优化模型的预算与性能之间的权衡,从而实现更高效的推理。

技术框架:整体架构包括BudgetDoc基准和DRB模型。BudgetDoc提供了多模态数据集,DRB则是一个约10亿参数的预估器,能够在不同预算水平下预测模型性能。

关键创新:最重要的创新在于引入了BudgetDoc基准和DRB模型,使得推理预算的动态分配成为可能,并且在多个配置中超越了传统的最大预算策略。

关键设计:DRB模型采用了SigLIP-2和Qwen3-0.6B的组合,使用特定的损失函数来优化性能预测,确保在不同预算下的准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,DRB模型在动态分配推理预算时,在15种配置中有9种情况下的F1分数与始终使用最大预算的基线相当或更高,且显著降低了推理成本,展示了其在跨模型选择中的潜力。

🎯 应用场景

该研究的潜在应用领域包括文档理解、信息检索和自动化办公等。通过优化推理预算的分配,能够在资源有限的情况下提高模型的推理效率和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Uniformly allocating inference reasoning budgets to LLMs is expensive and prone to over-thinking penalties; especially in document tasks where visual layouts drive complexity. To address this, we introduce BudgetDoc, the first multimodal benchmark providing explicit supervision for model-budget-performance trade-offs across three document tasks. Using BudgetDoc, we train DRB (Document-Reasoning Balancer), an approx. 1B-parameter pre-flight estimator (SigLIP-2 + Qwen3-0.6B) that predicts ordinal model performance across budget levels, achieving a 0.753 weighted F1. When dynamically allocating reasoning budgets across five frontier models and three datasets, DRB matches or improves F1 scores compared to always-maximum-budget baselines in 9 of 15 configurations while drastically reducing cost. Finally, preliminary evaluations demonstrate DRB's potential to generalize to cross-model selection.