Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

📄 arXiv: 2608.21022v1 📥 PDF

作者: Fengshun Wang, Jin'ang Han, Zhigang Tu

分类: cs.CV, cs.MM

发布日期: 2026-08-21

备注: Accept at ACM Multimedia 2026


💡 一句话要点

提出无训练的多模态LLM管道以解决微动作理解问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 微动作理解 多模态大语言模型 无训练系统 情感推理 动态路由机制

📋 核心要点

  1. 现有方法在微动作理解中面临挑战,无法有效描述动作细节及其背后的情感推理。
  2. 本文提出了一种基于冻结多模态大语言模型的无训练系统,动态路由任务以优化性能。
  3. 该系统在开放式任务中表现优异,平均得分为2.68,显著高于第二名的1.44,展示了其有效性。

📝 摘要(中文)

微动作是指人类在无意识状态下进行的细微、短暂且幅度较小的身体动作,如手指的轻微抖动或头部的轻微倾斜。这些动作能够可靠地反映出个体的情感和心理状态。理解微动作不仅仅是为其贴上标签,更需要模型能够描述身体部位的运动并合理推理出为何某个片段应归入特定的细粒度类别。本文提出了一种无训练、仅依赖提示的系统,该系统在MAC 2026微动作挑战赛的细粒度理解赛道中获得第一名,且不允许进行微调和真实标签监督。该系统完全基于冻结的多模态大语言模型(MLLM),动态将八个子任务路由到最适合的MLLM,显著提升了开放式任务的性能。

🔬 方法详解

问题定义:本文旨在解决微动作理解中的细粒度分类问题,现有方法往往无法准确描述动作细节及其情感推理,导致理解的局限性。

核心思路:提出了一种无训练、仅依赖提示的系统,利用冻结的多模态大语言模型(MLLM)来处理不同的子任务,确保每个任务都由最适合的模型执行。

技术框架:系统架构包括多个模块,首先对输入进行分析,然后根据任务类型动态选择合适的MLLM,分为闭合式识别任务和开放式描述与推理任务。

关键创新:最重要的创新在于无训练的设计理念,通过动态路由机制提升了模型在细粒度理解上的表现,与传统方法相比,避免了对大量标注数据的依赖。

关键设计:系统设计中采用了冻结的MLLM,确保在不进行微调的情况下,依然能够有效处理多种任务,关键参数设置和损失函数设计均旨在优化任务适配性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,该系统在开放式任务中取得了显著的性能提升,平均得分达到2.68,明显高于第二名的1.44,展示了其在微动作理解领域的优越性和有效性。

🎯 应用场景

该研究的潜在应用领域包括情感分析、人机交互、心理健康监测等。通过对微动作的理解,可以为情感识别和心理状态评估提供更为细致的支持,未来可能在社交机器人和虚拟助手中发挥重要作用。

📄 摘要(原文)

Micro-actions are subtle, short, low-amplitude body movements, such as a fidgeting hand or a slight head tilt, that humans perform with little conscious intent yet that reliably leak emotional and psychological state. Understanding them goes beyond assigning a label: a model must also describe which body parts move and reason, faithfully, about why a clip warrants a particular fine-grained category. We present the training-free, prompt-only system that won first place in the fine-grained understanding track (MA-Bench) of the MAC~2026 Micro-Action Challenge, where both fine-tuning and ground-truth supervision are disallowed. Built entirely upon frozen multimodal large language models (MLLMs), the system dynamically routes each of the eight sub-tasks to the MLLM empirically best suited for that task: a discriminative MLLM for closed-ended recognition tasks and a generative MLLM for open-ended description and reasoning tasks. This architecture achieves a statistically significant performance advantage on open-ended tasks, attaining an average score of 2.68 (on a five-point scale) compared to 1.44 for the second-best approach.