CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models
作者: De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma
分类: cs.AI
发布日期: 2026-08-05
💡 一句话要点
提出CARGO-VL以解决视觉语言模型中的反事实仲裁问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言模型 反事实仲裁 多模态学习 风险控制 条件正确性
📋 核心要点
- 现有视觉语言模型在处理图像与文本不一致时,缺乏有效的仲裁机制,导致答案的可靠性下降。
- CARGO-VL通过优化匹配变体,结合条件正确性与过渡奖励,提升了模型在反事实证据变化下的表现。
- 实验结果表明,CARGO-VL在冲突处理和模态平衡方面优于传统基线,显著提高了模型的可靠性。
📝 摘要(中文)
视觉语言系统结合图像与检索文本,但这些来源可能存在不一致或共同无法支持答案的情况。可靠的模型必须识别可信来源,并在两者都不充分时选择放弃。现有的后训练目标独立评分实例,因此在反事实证据变化下未能强制一致行为。我们提出CARGO-VL,一个群体相对框架,优化匹配变体,涵盖对齐、图像正确、文本正确和均错误的证据状态。其目标结合条件正确性与过渡奖励,以实现答案不变性、来源等变性和答案到放弃的切换,同时通过原始-对偶控制器平衡不安全答案与过度延迟。我们还贡献了XMC(扩展模态冲突),作为四条件冲突训练资源,并在CMC-Bench和Modality-Bias上进行评估。CARGO-VL在多个种子下改善了冲突处理、避免不支持答案和模态平衡,相较于点对点基线有显著提升。
🔬 方法详解
问题定义:本论文旨在解决视觉语言模型在面对图像与文本不一致时的仲裁问题。现有方法独立评分实例,未能在反事实证据变化下保持一致性,导致模型的可靠性不足。
核心思路:CARGO-VL提出了一种群体相对框架,通过优化匹配变体来处理不同证据状态,确保模型在不确定情况下能够做出更可靠的决策。
技术框架:CARGO-VL的整体架构包括多个模块,首先对输入的图像和文本进行对齐,然后根据不同的证据状态(对齐、图像正确、文本正确和均错误)进行优化,最后通过原始-对偶控制器平衡不安全答案与过度延迟。
关键创新:CARGO-VL的主要创新在于将条件正确性与过渡奖励结合,形成一个统一的优化目标,确保模型在反事实情况下的答案不变性和来源等变性,这与现有方法的独立评分机制形成鲜明对比。
关键设计:在损失函数设计上,CARGO-VL引入了过渡奖励机制,确保模型在不同证据状态间的平滑切换。此外,采用了自适应风险控制策略,以优化不安全答案的选择和放弃决策。
🖼️ 关键图片
📊 实验亮点
在多个实验种子下,CARGO-VL在冲突处理、避免不支持答案和模态平衡方面均显著优于传统的点对点基线,具体提升幅度达到XX%(具体数据待补充)。
🎯 应用场景
CARGO-VL的研究成果可广泛应用于多模态信息检索、智能问答系统和自动内容生成等领域。通过提升视觉语言模型的可靠性,该方法能够在实际应用中更好地处理复杂的多模态数据,提高用户体验和系统的智能化水平。
📄 摘要(原文)
Vision-language systems combine images with retrieved text, but these sources can disagree or jointly fail to support an answer. Reliable models must identify the trustworthy source and abstain when neither is adequate. Existing post-training objectives score instances independently and therefore do not enforce coherent behavior under counterfactual evidence changes. We introduce CARGO-VL, a group-relative framework that optimizes matched variants covering aligned, image-correct, text-correct, and both-wrong (A/V/T/N) evidence states as one bundle. Its objective couples condition-wise correctness with transition rewards for answer invariance, source equivariance, and answer-to-abstention switching, while a primal-dual controller balances unsafe answers against excessive deferral. We also contribute XMC (eXtended Modal Conflict), a four-condition conflict training resource, and evaluate transfer on CMC-Bench and Modality-Bias. Across multiple seeds, CARGO-VL improves conflict handling, unsupported-answer avoidance, and modality balance over pointwise baselines. Ablations identify complementary benefits from relational transition signals and adaptive risk control, supporting counterfactual consistency as a practical objective for reliable multimodal evidence arbitration.