MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
作者: Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie
分类: cs.CV
发布日期: 2026-07-30
💡 一句话要点
提出MPIE-Bench以解决多人物交互编辑中的解剖学问题
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion) 支柱五:交互与反应 (Interaction & Reaction)
关键词: 多人物交互 图像生成 解剖学评估 几何评分 计算机视觉 虚拟现实 编辑模型 数据集构建
📋 核心要点
- 现有的文本到图像和个性化编辑模型在处理多人物交互时存在显著缺陷,如肢体融合和身体穿透等解剖学问题。
- 论文提出了MPIE-Bench基准和MPIE-Eval评估方法,旨在通过新颖的接触时间几何评分来解决多人物交互编辑中的解剖学和几何问题。
- 实验结果表明,MPIE-Bench在多个编辑器上表现出更高的解剖学和交互评分,且与人类判断更为一致,显示出该方法的有效性。
📝 摘要(中文)
文本到图像和个性化编辑模型如今能够轻松合成高保真度的单一主体图像。然而,将多个命名人物放置于共享接触动作(如拥抱、携带或摔跤)中仍然暴露出重大缺陷:融合的肢体、虚构的肢端和相互穿透的身体。现有评估在很大程度上忽视了这些解剖和几何问题,而VLM作为评判者的检查表在交互方面往往饱和,错误对人类来说依然显而易见。我们引入了MPIE-Bench,这是一个包含2500个样本的基准,涵盖405个场景、14个交互类别和四种接触密度(C0-C3)。我们还提出了MPIE-Eval,其两个新轴从冻结的公共多人物网格重建中评分接触时间几何。解剖学询问每个人类质量是否由完整的重建身体集解释,而交互则询问这些身体之间的穿透和表面距离是否符合指令要求的接触。十个编辑器的结果显示,网格解剖学在两个不同模型上的最高得分为0.65,而网格交互为0.72,因此没有单一编辑器在两者上都表现良好,而VLM检查表则将相同图像的评分提高到0.95。五个评审者的研究确认,这两个轴比零-shot VLM评判者更能跟踪人类判断,且在每个权重和阈值的消融下排名保持一致。
🔬 方法详解
问题定义:论文要解决的具体问题是多人物交互编辑中的解剖学和几何错误,现有方法在这些方面表现不佳,导致生成图像中出现肢体融合和身体穿透等问题。
核心思路:论文的核心解决思路是引入MPIE-Bench基准和MPIE-Eval评估方法,通过分析接触时间几何来评估生成图像的解剖学和交互质量,从而提高多人物交互编辑的准确性。
技术框架:整体架构包括数据集构建、编辑模型评估和评分机制。数据集包含2500个样本,涵盖多种交互类别和接触密度,评估则通过解剖学和交互两个新轴进行。
关键创新:最重要的技术创新点在于引入了基于多人物网格重建的接触时间几何评分方法,能够更准确地评估生成图像的解剖学和交互质量,与现有方法相比具有更高的评估精度。
关键设计:在设计中,采用了新的评分机制,结合了接触时间和几何特征,使用了多个编辑器进行评估,并通过五个评审者的研究验证了评分的有效性和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MPIE-Bench在解剖学和交互评分上分别达到了0.65和0.72,而VLM检查表的评分则高达0.95。五个评审者的研究表明,MPIE-Eval的评分与人类判断更为一致,验证了该方法的有效性和可靠性。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉、虚拟现实和游戏开发等,能够为多人物交互场景的生成和编辑提供更高的准确性和真实感。未来,该方法可能推动更复杂的交互场景生成技术的发展,提升用户体验和内容创作的质量。
📄 摘要(原文)
Text-to-image and personalized editing models now synthesize high-fidelity single-subject images with ease. Yet placing multiple named people into shared contact actions such as embrace, carry, or grapple still exposes major failures: fused limbs, invented extremities, and interpenetrating bodies. Existing evaluations largely overlook these anatomical and geometric issues, and VLM-as-a-judge checklists often saturate on Interaction while the errors remain obvious to humans. We introduce MPIE-Bench, a 2,500-sample benchmark of video-mined editing triplets spanning 405 scenes, 14 interaction categories, and four contact densities (C0-C3). We also propose MPIE-Eval, whose two new axes score contact-time geometry from a frozen public multi-person mesh reconstruction. Anatomy asks whether every human-like mass is explained by a complete set of reconstructed bodies, and Interaction asks whether the penetration and surface distance between those bodies match the contact the instruction asked for. Across ten editors, mesh Anatomy tops out at 0.65 and mesh Interaction at 0.72 on two different models, so no single editor is strong on both, while VLM checklists rate the same images above 0.95. A five-rater study confirms that both axes track human judgement more closely than a zero-shot VLM judge, and the rankings hold under ablation of every weight and threshold.