AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
作者: Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang
分类: cs.CV, cs.AI
发布日期: 2026-08-03
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出AdaThinkV以解决视频推理中的令牌效率问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视频推理 自适应推理 链式思维 多模态模型 强化学习 效率优化 变异恢复策略
📋 核心要点
- 现有方法在处理简单视频问题时,往往会浪费大量解码令牌,导致效率低下。
- AdaThinkV通过自适应调整推理模式,能够根据问题的复杂性选择显式推理或直接回答,提升了推理效率。
- 实验结果显示,AdaThinkV在视频推理任务中取得了40.79的平均准确率,相比最强基线提升了2.98点,同时减少了22.7%的令牌使用。
📝 摘要(中文)
链式思维(CoT)推理可以提高在复杂视频问题上的表现,但在简单问题上往往浪费解码令牌。我们研究了视频多模态大语言模型是否能够根据每个问题自适应调整推理努力。我们提出了AdaThinkV,这是一个自适应视频推理框架,能够在没有离线难度标签、手动调整的置信阈值或外部路由器的情况下学习是否进行显式推理。在强化学习过程中,AdaThinkV为每个提示采样匹配的显式推理和直接回答模式。通过平衡准确性增益与额外响应长度,ThinkGain估计显式推理的提示级效用,为条件响应生成和自主模式选择提供监督。在推理阶段,AdaThinkV选择响应模式并在单个自回归序列中生成响应。在统一的视频推理评估中,AdaThinkV的平均准确率为40.79,输出令牌平均为257.20,超越了最强的自适应基线2.98点,同时使用了22.7%的更少令牌。
🔬 方法详解
问题定义:本论文旨在解决视频推理中存在的令牌效率问题,现有方法在简单问题上往往浪费解码令牌,导致性能下降。
核心思路:AdaThinkV的核心思路是通过自适应选择推理模式,针对不同复杂度的问题决定是否进行显式推理,从而提高整体效率。
技术框架:AdaThinkV的整体架构包括两个主要模块:显式推理和直接回答模式。在强化学习阶段,通过匹配的回滚采样来训练模型,并使用ThinkGain评估推理的效用。
关键创新:引入了变异恢复策略优化(VRPO),该策略能够保留并逐步扩展难度较大的问题组,以从中恢复有用的信号,这是与现有方法的本质区别。
关键设计:在训练过程中,使用了特定的损失函数来平衡准确性和响应长度,同时在推理阶段,AdaThinkV能够在单个自回归序列中生成响应,提升了效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AdaThinkV在统一的视频推理评估中取得了40.79的平均准确率,输出令牌平均为257.20,超越了最强自适应基线2.98点,同时减少了22.7%的令牌使用,展示了其在令牌效率上的显著提升。
🎯 应用场景
该研究的潜在应用领域包括视频问答、智能监控和教育等场景。通过提高视频推理的效率,AdaThinkV能够在实时系统中更好地处理复杂问题,具有重要的实际价值和未来影响。
📄 摘要(原文)
Chain-of-thought (CoT) reasoning can improve performance on difficult video questions but often wastes decoding tokens on simple ones. We study whether a video multimodal large language model can adapt its reasoning effort to each question. We propose AdaThinkV, an adaptive framework for video reasoning that learns whether to reason explicitly without offline difficulty labels, manually tuned confidence thresholds, or an external router. During reinforcement learning, AdaThinkV samples matched rollouts in explicit reasoning and direct answering modes for each prompt. ThinkGain estimates the prompt-level utility of explicit reasoning by balancing its accuracy gain against additional response length, providing supervision for both conditional response generation and autonomous mode selection. For difficult prompts, limited rollout exploration can yield groups in which every response is unsuccessful and accuracy rewards show little variation, providing insufficient signal for learning. We therefore introduce Variance Recovery Policy Optimization (VRPO), which retains and progressively expands these groups to recover informative signals from prompts that are difficult yet solvable. At inference, AdaThinkV selects a response mode and generates the response in a single autoregressive sequence. Across a unified suite of video reasoning evaluations, AdaThinkV achieves a mean accuracy of 40.79 with an average of 257.20 output tokens, outperforming the strongest evaluated adaptive baseline by 2.98 points while using 22.7% fewer tokens. Project page: https://trilarflagz.github.io/AdaThinkV/