Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

📄 arXiv: 2608.04311v1 📥 PDF

作者: Russell Taylor, Benjamin Herbert, Michael Sana

分类: cs.CL

发布日期: 2026-08-05


💡 一句话要点

提出多代理翻译方法以解决语言间双关语翻译问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 双关语翻译 多代理系统 音义嵌入 大型语言模型 机器翻译 语言学约束 创造性翻译

📋 核心要点

  1. 双关语的翻译面临语言间的文化和语义差异,现有方法往往难以传达其幽默和创造性。
  2. 本文提出结合大型语言模型与音义嵌入的多代理框架,通过迭代评估生成更具创造性的双关语翻译。
  3. 在CLEF JOKER 2025 Task 2比赛中,提出的方法在专家评估中表现优异,显示出相较于基线方法的有效性。

📝 摘要(中文)

翻译双关语一直是专业翻译人员和机器翻译系统面临的挑战。本文探讨了三种将英语双关语翻译为法语的方法,结合了大型语言模型与语言学约束。基线方法使用大型语言模型,并通过正负法语示例的反馈进行优化。引导推理管道利用音义嵌入检索双关语生成的词汇候选。最后,多代理框架通过专门的反馈迭代评估和再生成候选翻译。我们的目标是保留源文本双关语的语言创造性、模糊性和幽默感,而不仅仅是重现其词汇。在CLEF JOKER 2025 Task 2比赛中,多代理和引导思维链系统在专家评估中分别排名第一和第二,尽管BLEU和BERTScore的提升有限。这表明,显式的音义引导和迭代的多代理评估能够相对于直接的判别器引导生成改善基于LLM的双关语翻译,尤其是在平衡语义保真度、音韵相似性和自然目标语言表达时。

🔬 方法详解

问题定义:本文旨在解决双关语在语言间翻译时的文化和语义差异问题。现有方法往往无法有效传达双关语的幽默感和创造性,导致翻译质量不高。

核心思路:论文提出结合大型语言模型与音义嵌入的多代理框架,通过引导推理和迭代评估来生成更具创造性的翻译,旨在保留源文本的语言特性。

技术框架:整体架构包括三个主要模块:基线模型、引导推理管道和多代理评估系统。基线模型使用大型语言模型进行初步翻译,引导推理管道利用音义嵌入检索候选词汇,而多代理系统则通过反馈迭代优化翻译结果。

关键创新:最重要的创新在于引入音义嵌入和多代理评估机制,使得翻译不仅关注字面意义,还能保留双关语的幽默和创造性。这一方法与传统的直接翻译方法本质上不同。

关键设计:在模型设计中,采用了特定的损失函数来平衡语义保真度和音韵相似性,同时在多代理评估中引入了专家反馈机制,以确保翻译的自然性和流畅性。具体参数设置和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CLEF JOKER 2025 Task 2比赛中,提出的多代理和引导思维链系统分别获得第一和第二名,显示出其在专家评估中的优越性。尽管BLEU和BERTScore的提升幅度有限,但在语义保真度和自然表达方面的改善显著,表明该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括跨语言的文学翻译、广告文案创作以及多语言内容生成等。通过提升双关语的翻译质量,可以增强文化交流的趣味性和有效性,未来可能对机器翻译系统的设计和应用产生深远影响。

📄 摘要(原文)

Translating wordplay across languages has long challenged both professional translators and machine translation systems. We investigate three approaches to translating puns from English to French by combining large language models with linguistic constraints for wordplay generation. Our baseline uses a large language model with feedback from a discriminator prompted with positive and negative French examples. Our guided reasoning pipeline uses combined phonetic-semantic embeddings to retrieve lexical candidates for wordplay generation. Finally, our multi-agent framework iteratively evaluates and regenerates candidate translations using specialized feedback. Moving beyond literal translation, our objective is to preserve the linguistic creativity, ambiguity, and humor of the source-text wordplay rather than simply reproduce its vocabulary. The multi-agent and guided chain-of-thought systems ranked first and second, respectively, in the CLEF JOKER 2025 Task 2 competition under expert human evaluation, despite only modest improvements in BLEU and BERTScore. These findings suggest that both explicit phonetic-semantic guidance and iterative multi-agent evaluation can improve LLM-based wordplay translation relative to direct discriminator-guided generation, particularly when balancing semantic fidelity, phonetic similarity, and natural target-language expression