Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

📄 arXiv: 2608.03204v1 📥 PDF

作者: Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

分类: cs.CL, cs.AI

发布日期: 2026-08-04


💡 一句话要点

提出轨迹引导的结构化采样方法以解决视觉语言模型对齐问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 轨迹引导 结构化采样 推理优化 多模态推理

📋 核心要点

  1. 现有的RL对齐方法资源密集,且训练目标与推理时分布不匹配,导致效果不理想。
  2. 提出了一种轨迹引导的结构化采样方法,通过动态推理时的精细调整实现更好的对齐效果。
  3. 在多个多模态推理数据集上,实验结果显示该方法显著提高了准确性,且推理开销可控。

📝 摘要(中文)

后训练强化学习(RL)算法通常用于将大型视觉语言模型(LVLMs)与人类意图及视觉推理任务的要求对齐。然而,现有的基于RL的对齐方法往往资源密集,并且在训练目标与推理时分布之间存在不匹配。为了解决这一问题,本文提出了一种新颖的测试时对齐方法,利用轨迹引导的结构化采样进行动态推理时的精细调整,从而实现更好的视觉基础对齐并确保逻辑一致性。该方法通过轨迹学习算法策划推理记忆库,将复杂问题解决分解为有序的预定义推理模式序列,并通过收集轨迹建立全局结构推理先验,随后使用迭代的马尔可夫链蒙特卡洛(MCMC)算法进行局部多目标的推理轨迹精细调整。实验结果表明,该方法在多个多模态推理数据集上显著提高了准确性,且没有产生过高的推理开销。

🔬 方法详解

问题定义:本文旨在解决大型视觉语言模型在推理时与人类意图及视觉推理任务要求之间的对齐问题。现有的RL对齐方法在资源消耗和目标不匹配方面存在显著不足。

核心思路:提出了一种轨迹引导的结构化采样方法,通过建立推理记忆库和使用MCMC算法进行动态推理时的调整,以实现更好的视觉基础对齐和逻辑一致性。

技术框架:整体流程包括两个主要阶段:首先通过轨迹学习算法建立推理记忆库,随后从中收集轨迹以建立全局结构推理先验,并利用MCMC算法进行局部多目标的推理轨迹精细调整。

关键创新:最重要的创新在于引入轨迹引导的结构化采样方法,作为传统后训练对齐的可扩展有效替代方案,特别适用于复杂的视觉推理任务。

关键设计:在参数设置上,采用了预定义的推理模式序列,并在MCMC算法中设计了局部多目标优化策略,以确保推理过程的高效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在多个多模态推理数据集上显著提高了准确性,具体提升幅度达到XX%,且推理开销保持在合理范围内,展示了其作为传统对齐方法的有效替代方案的潜力。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、图像描述生成以及多模态交互等。通过提高视觉语言模型的推理能力,能够在实际应用中更好地理解和处理复杂的视觉信息,提升用户体验和系统性能。

📄 摘要(原文)

Post-training reinforcement learning (RL) algorithms are commonly used to align large vision-language models (LVLMs) with human intent and the requirements of visual reasoning tasks. However, existing RL-based alignment methods are often resource-intensive and encounter mismatches between training objectives and inference-time distributions. To bridge this gap, we propose a novel test-time alignment approach that leverages trajectory-guided structured sampling for dynamic inference-time refinement, achieving better alignment with visual grounding and ensuring logical consistency. Our approach begins with curating a reasoning memory bank via a trajectory learning algorithm, which decomposes complex question solving into ordered sequences of predefined reasoning patterns. It subsequently accomplishes inference-time alignment by first collecting trajectories from reasoning memory bank to establish a global structural reasoning prior, and then using an iterative Markov Chain Monte Carlo (MCMC) algorithm for localized multi-objective refinement of the reasoning trace. Experiments across multiple multimodal reasoning datasets demonstrate that our approach significantly improves accuracy without incurring prohibitive inference overhead. These results establish trajectory-guided test-time sampling as a scalable and effective alternative to traditional post-training alignment, particularly for complex visual reasoning tasks.