Multi-Person Human Motion Forecasting in Complex Scenes
作者: Serdar Ozsoy, Lars Doorenbos, Juergen Gall
分类: cs.CV, cs.AI
发布日期: 2026-08-27
备注: Accepted to GCPR 2026
💡 一句话要点
提出对象条件社交扩散模型以解决复杂场景中的多人运动预测问题
🎯 匹配领域: 支柱五:交互与反应 (Interaction & Reaction) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 多人运动预测 社交互动建模 对象条件机制 复杂场景理解 条件扩散模型
📋 核心要点
- 现有方法在复杂场景中预测多人运动时,难以有效整合物体信息和社交互动,导致预测精度不足。
- 本文提出的OCSD模型通过对象条件机制和社交编码器,统一处理运动历史、互动和物体线索,提升了预测能力。
- 实验结果显示,OCSD在HiK和HOI-M3基准上分别减少了31.3%和33.2%的路径误差,生成了更为真实的长期预测。
📝 摘要(中文)
准确预测复杂场景中人类的运动需要对整个环境的过去和现在状态进行推理。在此背景下,有效地将物体信息和社交互动整合到统一框架中仍然是一个特别具有挑战性的任务。为了解决这个问题,本文提出了对象条件社交扩散(OCSD)模型,这是一种条件扩散模型,将运动历史、多人互动和物体线索整合到一个框架中。OCSD使用对象条件机制,在每个时间步调节去噪过程,从而实现细粒度的人物-物体推理,并通过社交编码器建模场景中所有人类之间的互动。因此,该模型自然处理不同的群体规模和复杂的社交互动,并支持采样多个合理的未来。大量实验表明,OCSD在“厨房中的人类”(HiK)和HOI-M3基准上达到了最先进的结果。
🔬 方法详解
问题定义:本文旨在解决复杂场景中多人运动预测的挑战,现有方法在整合物体信息和社交互动方面存在不足,导致预测结果不够准确。
核心思路:OCSD模型通过对象条件机制调节去噪过程,结合社交编码器建模人际互动,从而实现对运动历史和环境信息的全面考虑,提升预测的准确性和合理性。
技术框架:OCSD的整体架构包括三个主要模块:对象条件机制、社交编码器和运动预测模块。对象条件机制在每个时间步调节去噪,社交编码器负责建模人际互动,运动预测模块则生成未来运动轨迹。
关键创新:OCSD的主要创新在于将对象条件机制与社交编码器结合,形成统一的预测框架。这一设计使得模型能够自然处理不同规模的群体和复杂的社交互动,显著提升了预测的灵活性和准确性。
关键设计:模型中采用了特定的损失函数来优化去噪过程,网络结构设计上考虑了多层次的特征提取,以便更好地捕捉运动历史和社交互动的复杂性。
🖼️ 关键图片
📊 实验亮点
OCSD模型在“厨房中的人类”(HiK)和HOI-M3基准上分别减少了121.5毫米(31.3%)和130.5毫米(33.2%)的两秒路径误差,超越了现有方法,生成了更为真实的长期预测结果。
🎯 应用场景
该研究的潜在应用领域包括智能监控、自动驾驶、虚拟现实和人机交互等。通过准确预测人类运动,能够提升系统的响应能力和安全性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Accurately forecasting the movement of people in complex scenes requires reasoning over the past and present state of the entire environment. In this context, effectively incorporating object information and social interactions into a unified framework remains particularly challenging. To address this, we propose Object-Conditioned Social Diffusion (OCSD), a conditional diffusion model that integrates motion history, multi-person interactions, and object cues into a single framework. OCSD uses an object-conditioning mechanism that modulates denoising at every timestep, enabling fine-grained human-object reasoning, and a social encoder that models the interactions between all humans in the scene. As a result, our model naturally handles varying group sizes, complex social interactions, and supports sampling multiple plausible futures. Extensive experiments show that OCSD achieves state-of-the-art results on the Humans in Kitchens (HiK) and HOI-M3 benchmarks. It reduces the two-second path error by 121.5 mm (31.3%) on HiK and 130.5 mm (33.2%) on HOI-M3 compared to prior work, and produces more realistic long-term forecasts.