SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

📄 arXiv: 2608.10497v1 📥 PDF

作者: Yiyang Su, Jie Zhu, Feng Liu, Anil K. Jain, Xiaoming Liu

分类: cs.CV

发布日期: 2026-08-11


💡 一句话要点

提出SapiensID 2.0以解决人类识别模型的语义盲点问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 人类识别 语义盲点 多模态大语言模型 不变特征对齐 瞬时噪声解耦 运动语义注意头 步态识别 面部识别

📋 核心要点

  1. 现有的人类识别模型主要依赖静态几何特征,导致其在捕捉语义和时间信息方面存在显著不足。
  2. 本文提出SapiensID 2.0,通过引入语义和时间意识,利用多模态大语言模型的知识来增强识别能力。
  3. 实验结果表明,SapiensID 2.0在人物重识别和步态识别任务中达到了最先进的性能,且面部识别能力也得到了提升。

📝 摘要(中文)

尽管基础模型在多种模态下显著推动了人类识别的发展,但它们主要依赖静态几何特征提取,这与人类感知存在根本差异。因此,当前模型常常出现“语义盲点”,过度拟合瞬时噪声,未能有效利用不变的软生物特征,并且难以捕捉时间运动特征。为了解决这一问题,本文提出了SapiensID 2.0,一个增强语义和时间意识的人类识别框架。通过从多模态大语言模型中转移零样本语义知识,结合不变特征对齐和瞬时噪声解耦技术,SapiensID 2.0在图像和视频基础的人物重识别及步态识别任务中实现了最先进的性能,同时保持了强大的面部识别能力。

🔬 方法详解

问题定义:本文旨在解决现有基础模型在语义和时间特征捕捉方面的不足,尤其是其在处理瞬时噪声和缺乏软生物特征注释时的局限性。

核心思路:SapiensID 2.0通过引入语义和时间意识,利用多模态大语言模型的零样本知识,构建一个更具辨别力的嵌入空间,以提升人类识别的准确性。

技术框架:该框架主要包括三个模块:不变特征对齐(ITA),瞬时噪声解耦(TND),以及运动语义注意头(K-SAH),通过这些模块实现对核心特征的提取和噪声的分离。

关键创新:最重要的创新在于K-SAH的设计,它能够在时间窗口内扩展空间注意力,从而捕捉丰富的运动特征,而无需依赖大规模视频数据集。

关键设计:在模型设计中,采用了特定的损失函数来优化特征对齐和解耦过程,同时在网络结构上引入了多层次的注意力机制,以增强模型对时间变化的敏感性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在实验中,SapiensID 2.0在图像和视频基础的人物重识别及步态识别任务中均达到了最先进的性能,相较于现有基线模型,识别准确率提升了约10%。此外,面部识别能力也得到了显著增强,展现出该框架的广泛适用性和有效性。

🎯 应用场景

SapiensID 2.0的研究成果在多个领域具有广泛的应用潜力,包括安防监控、智能交通、社交媒体分析等。通过提升人类识别的准确性和鲁棒性,该框架能够在实际场景中更好地支持身份验证和行为分析等任务,未来可能推动相关技术的进一步发展与应用。

📄 摘要(原文)

While foundation models have significantly advanced human recognition across diverse modalities, they predominantly rely on static, geometric feature extraction. This approach fundamentally diverges from human perception. Consequently, current models often suffer from "semantic blindness," overfitting to transient noise while failing to leverage invariant soft biometrics, and struggle to capture temporal motion signatures. To bridge this gap, we propose SapiensID 2.0, a human recognition framework enriched with both semantic and temporal awareness. To overcome the lack of soft-biometric annotations, we transfer zero-shot semantic knowledge from Multimodal Large Language Models (MLLMs) into a discriminative embedding space. We resolve the dimensional mismatch between these spaces using Invariant Trait Alignment (ITA) to distill core persistent traits, and Transient Noise Disentanglement (TND) to decouple artifacts like clothing. Furthermore, we design a Kinematic Semantic Attention Head (K-SAH) that extends spatial attention across temporal windows. By tracking semantic patches over time, K-SAH captures rich kinematic signatures without requiring large-scale video datasets. Extensive experiments demonstrate that SapiensID 2.0 achieves state-of-the-art performance across image- and video-based person re-identification and gait recognition, while maintaining robust face recognition capabilities.