SignRR: Retrieve and Refine Real Motion for Sign Language Production

📄 arXiv: 2608.28568v1 📥 PDF

作者: Fidel Omar Tito Cruz, Angie Sanchez Marquina, Summy Farfan, Gissella Bejarano

分类: cs.CV

发布日期: 2026-08-28

备注: Accepted at the 37th British Machine Vision Conference (BMVC 2026)


💡 一句话要点

提出SignRR以解决手语生成中的运动一致性问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 手语生成 运动一致性 检索与精炼 深度学习 残差VQ-VAE 人机交互 自然语言处理

📋 核心要点

  1. 现有手语生成方法在保留稀有手部配置和签署者特征方面存在不足,导致生成的手语动作不够自然。
  2. 本文提出的SignRR框架结合了检索和学习精炼,利用真实手语片段提供真实的表达,并确保全局一致性。
  3. 实验结果显示,SignRR在反向翻译性能上达到了最先进水平,同时在姿势质量上也表现出色。

📝 摘要(中文)

手语生成(SLP)旨在从口语生成连续的手语动作,通常通过从词汇到姿势的生成实现。现有方法主要分为两类:生成模型和基于检索的方法。生成模型在没有观察到的手语实例的情况下合成动作,难以保留稀有的手部配置和特定签署者的表达;而检索方法重用真实的手语动作片段,但在不同签署者和共发音上下文中拼接片段可能导致节奏和风格的不一致。为了解决这些问题,本文提出了一种检索与精炼相结合的框架SignRR,利用真实的手语片段初始化动作,并通过部分感知的残差VQ-VAE对整个序列进行精炼。实验结果表明,SignRR在PHOENIX14T和CSL-Daily数据集上实现了最先进的反向翻译性能,同时保持了竞争力的姿势质量。

🔬 方法详解

问题定义:本文旨在解决手语生成中的运动一致性问题,现有方法在生成稀有手部配置和保持签署者特征方面存在挑战。

核心思路:SignRR框架通过检索真实的手语片段作为初始化,并利用学习的精炼过程确保生成序列的全局一致性,避免了从头生成的缺陷。

技术框架:该框架包括两个主要模块:首先,从真实手语片段字典中检索初始化动作;其次,使用部分感知的残差VQ-VAE对整个序列进行精炼,以保持手部细节和时间长度差异。

关键创新:SignRR的创新在于结合了检索与精炼的策略,利用真实数据的优势,同时通过学习机制确保生成序列的连贯性,这与传统的单一生成或检索方法有本质区别。

关键设计:在技术细节上,使用了残差量化以保留细微的手部动作,且在潜在空间中处理时间长度差异,确保生成的手语动作既真实又自然。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SignRR在PHOENIX14T和CSL-Daily数据集上实现了最先进的反向翻译性能,具体性能数据未提供,但相较于基线方法,SignRR在姿势质量上保持了竞争力,显示出显著的提升幅度。

🎯 应用场景

该研究的潜在应用领域包括手语翻译、教育和人机交互等。通过提高手语生成的自然性和一致性,SignRR可以帮助聋哑人士更好地与社会沟通,同时也为手语学习提供了更有效的工具,具有重要的社会价值和影响力。

📄 摘要(原文)

Sign language production (SLP) aims to generate continuous signing motion from spoken language, often through gloss-to-pose generation. Prior work mainly follows two paradigms. Generative models synthesize motion from a learned prior or from noise, without reference to an observed signing instance, making rare hand configurations and signer-specific articulation difficult to preserve. Retrieval-based methods reuse real, well-articulated motion segments, but concatenating segments from different signers and co-articulation contexts can introduce rhythm and style inconsistencies across the full sequence, not only at segment boundaries. These limitations suggest a complementary solution: use retrieval to provide realistic articulation, and use learned refinement to impose the global coherence that retrieval alone lacks. We therefore propose retrieve-and-refine, a paradigm that starts from real retrieved motion and refines it into a globally coherent signing sequence rather than generating motion from scratch. Our framework, SignRR, initializes motion from a dictionary of real sign segments and refines the full sequence with a part-aware Residual VQ-VAE, where residual quantization preserves fine hand articulation and temporal length differences are handled in the latent space. Experiments on PHOENIX14T and CSL-Daily show that SignRR achieves state-of-the-art back-translation performance while maintaining competitive pose quality.