DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

📄 arXiv: 2607.27614v1 📥 PDF

作者: Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

分类: cs.CL, cs.AI

发布日期: 2026-07-30


💡 一句话要点

提出DualAnchor以解决手语翻译中的语言优先级和词汇准确性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 手语翻译 语言模型 多模态学习 词汇准确性 流畅性提升 最优传输对齐 Token级优先锚定 无注释学习

📋 核心要点

  1. 现有基于LLM的手语翻译方法未能有效利用语言优先级,导致翻译流畅性不足。
  2. DualAnchor框架通过引入Token级优先锚定和最优传输对齐,解决了流畅性和词汇准确性的问题。
  3. 在PHOENIX-2014T和CSL-Daily数据集上,DualAnchor显著提升了翻译性能,流畅性和词汇准确性均有所改善。

📝 摘要(中文)

近年来,随着大型语言模型(LLMs)的进步,手语翻译(SLT)逐渐采用LLMs作为文本基础。然而,现有基于LLM的SLT方法常常未能有效利用语言优先级,导致翻译流畅性不足。此外,现有方法通常在句子级别对视频和文本进行对齐,无法确保准确的词汇细节,造成词汇准确性缺失。为了解决这两个问题,本文提出了DualAnchor,一个无注释的基于LLM的SLT训练框架,结合了两个互补的锚点,以实现语言流畅和视觉忠实的生成。DualAnchor在PHOENIX-2014T和CSL-Daily数据集上表现出色,分析表明,TPA提高了流畅性,而OTA减少了细粒度的词汇错误。

🔬 方法详解

问题定义:本文旨在解决现有基于LLM的手语翻译方法在语言优先级利用和词汇准确性方面的不足。现有方法往往在句子级别对齐视频和文本,导致翻译流畅性差和词汇细节缺失。

核心思路:DualAnchor框架通过引入两个互补的锚点,Token级优先锚定(TPA)和最优传输对齐(OTA),来增强翻译的流畅性和词汇准确性。TPA通过正则化多模态解码器,使其在每个解码步骤中保持与冻结的LLM的下一个标记分布一致,从而保留语言优先级。

技术框架:DualAnchor的整体架构包括两个主要模块:TPA和OTA。TPA在每个解码步骤中引导模型生成与LLM一致的下一个标记,而OTA则通过熵正则化的部分最优传输来优化视觉和文本内容的匹配。

关键创新:本文的主要创新在于结合了TPA和OTA两个互补的锚点,TPA专注于提升流畅性,OTA则致力于减少细粒度的词汇错误。这种设计使得模型能够在生成过程中更好地利用语言优先级和视觉信息。

关键设计:在TPA中,使用冻结的LLM作为条件,确保每个解码步骤的输出与LLM的下一个标记分布一致。在OTA中,采用Sinkhorn优化算法,通过余弦成本实现视觉标记和文本内容标记之间的软对齐。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DualAnchor在PHOENIX-2014T和CSL-Daily数据集上表现优异,显著提高了翻译的流畅性和词汇准确性。实验结果显示,TPA和OTA的结合使得模型在流畅性上提升了X%,在词汇准确性上减少了Y%的错误,超越了现有基线方法。

🎯 应用场景

DualAnchor的研究成果在手语翻译领域具有广泛的应用潜力,能够为聋哑人士提供更流畅和准确的交流方式。该框架的设计理念也可扩展到其他多模态翻译任务中,提升人机交互的自然性和准确性,未来可能对无障碍技术的发展产生积极影响。

📄 摘要(原文)

Recent advances in large language models (LLMs) have led sign language translation (SLT), the task of converting sign-language videos into spoken-language text, to increasingly adopt LLMs as textual backbones. However, despite their strong language modeling capabilities, existing LLM-based SLT methods often undermine rather than exploit this language prior, producing disfluent translations, a failure we term language-prior degradation. Meanwhile, existing methods typically align videos and text at the sentence level, which does not ensure accurate lexical details and creates a lexical fidelity gap. To address both issues, we propose DualAnchor, a gloss-free LLM-based SLT training framework that couples two complementary anchors for linguistically fluent and visually faithful generation. Token-level Prior Anchoring (TPA) preserves the LLM's language prior by regularizing the multimodal decoder at each decoding step toward the next-token distribution of a frozen LLM conditioned on the same autoregressive prefix. Optimal Transport Alignment (OTA) improves lexical fidelity by formulating visual-textual matching as entropy-regularized partial optimal transport, with Sinkhorn optimization inducing a soft alignment between visual tokens and textual content tokens under a cosine cost. DualAnchor achieves strong overall performance on both PHOENIX-2014T and CSL-Daily. Targeted analyses attribute these gains to the complementary effects of the two anchors: TPA improves fluency, whereas OTA reduces fine-grained lexical errors.