VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

📄 arXiv: 2608.02217v1 📥 PDF

作者: Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

分类: cs.CV

发布日期: 2026-08-03

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出VC-Tooler以解决视觉工具使用的适应性与组合性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉工具使用 多模态推理 强化学习 组合性能力 适应性能力

📋 核心要点

  1. 现有方法主要集中于固定工具空间和刚性调用模式,导致组合和适应能力不足,无法有效应对复杂的视觉工具使用场景。
  2. VC-Tooler通过构建轨迹库和分阶段训练,学习视觉工具的组合性和适应性,提升了工具使用的灵活性和准确性。
  3. 在多个基准测试中,VC-Tooler表现出色,尤其在V*和VTC-Bench上分别达到了95.8%和35.3%的性能,显示出显著的提升。

📝 摘要(中文)

代理多模态推理扩展了被动图像理解,使得视觉语言模型能够通过视觉工具交互主动获取和完善视觉证据。有效的视觉工具使用需要三个能力:在视觉上下文中定位工具调用、跨多个步骤组合工具以及根据工具返回的观察结果调整推理。然而,现有方法主要集中在固定工具空间和刚性调用模式的基础上,组合和适应能力不足。我们提出了VC-Tooler,将视觉工具使用学习为一种组合性和适应性能力。为此,我们首先通过层次合成管道构建了一个轨迹库,涵盖单工具定位、多工具组合和多样化工具上下文与接口三个能力层级。然后,我们分两个阶段训练模型:首先进行监督冷启动以建立这些能力,随后通过强化学习鼓励准确、高效和上下文感知的视觉工具使用。VC-Tooler在通用和代理基准测试中均实现了开源模型的最先进性能,包括在V*上达到95.8%和在VTC-Bench上达到35.3%,并在推理时在更丰富的工具设置下显示出良好的迁移能力。

🔬 方法详解

问题定义:本论文旨在解决视觉工具使用中的组合性和适应性问题。现有方法在工具调用的灵活性和上下文适应性方面存在不足,限制了其在复杂场景中的应用。

核心思路:VC-Tooler的核心思路是通过构建一个层次化的轨迹库,涵盖不同的能力层级,结合监督学习和强化学习,来实现视觉工具的有效使用。这样的设计使得模型能够在多种上下文中灵活调用工具。

技术框架:整体架构包括三个主要模块:单工具定位、多工具组合和多样化工具上下文与接口。首先通过监督学习建立基础能力,然后通过强化学习优化工具使用的准确性和效率。

关键创新:最重要的技术创新在于将视觉工具使用视为一种组合性和适应性能力,而非固定模式的调用。这一方法突破了传统方法的局限,使得模型能够在动态环境中灵活应对。

关键设计:在训练过程中,采用了分阶段的策略,初期通过监督学习建立基础能力,后期通过强化学习优化模型的表现。损失函数设计上,强调了上下文感知和工具使用的效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

VC-Tooler在多个基准测试中表现优异,特别是在V*上达到了95.8%的准确率,在VTC-Bench上达到了35.3%。这些结果显示出相较于现有方法的显著提升,尤其是在工具使用的灵活性和上下文适应性方面。

🎯 应用场景

VC-Tooler的研究成果在多个领域具有潜在应用价值,包括智能助手、机器人操作、增强现实等场景。通过提升视觉工具的使用能力,能够更好地支持复杂任务的执行,推动人机交互的智能化进程。

📄 摘要(原文)

Agentic multimodal reasoning extends passive image understanding by allowing VLMs to actively acquire and refine visual evidence through visual tool interactions. Effective visual tool use requires three capabilities: grounding tool calls in visual context, composing tools across multiple steps, and adapting reasoning to tool-returned observations. However, existing approaches largely focus on grounding within fixed tool spaces and rigid invocation patterns, leaving composition and adaptation insufficiently addressed. We present VC-Tooler, which learns visual tool use as a compositional and adaptive capability. To this end, we first build a trajectory bank through a hierarchical synthesis pipeline covering three capability levels: single-tool grounding, multi-tool composition, and diverse tool contexts and interfaces. We then train the model in two stages: a supervised cold start that establishes these capabilities, followed by reinforcement learning that encourages accurate, efficient, and context-aware visual tool use. VC-Tooler achieves state-of-the-art performance among open-source models on both general-purpose and agentic benchmarks, including $95.8\%$ on V* and $35.3\%$ on VTC-Bench, and shows promising transfer under richer tool settings at inference time. Project page: https://w1zheng.github.io/VC-Tooler