When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

📄 arXiv: 2608.27658v1 📥 PDF

作者: Sanjeev Kumar, Atsuki Yamaguchi, Nikolaos Aletras

分类: cs.CL

发布日期: 2026-08-27

备注: Accepted to EMNLP 2026


💡 一句话要点

提出适应性层次网络框架以解决低资源语言处理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 低资源语言 字节级模型 层次网络 词性标注 自然语言处理 块对齐损失 子词表示

📋 核心要点

  1. 现有的子词分词方法在低资源语言处理上存在局限,导致频率模式的强加和表示不对齐。
  2. 本文提出了一种适应性层次网络框架,通过直接初始化字节嵌入和应用块对齐损失来解决模态差距。
  3. 实验结果显示,该方法在六种语言的词级形态学任务中显著提升,词性标注的准确率提高了13.3%。

📝 摘要(中文)

子词分词在处理低资源语言时受到限制,因为它将主导语言的频率模式强加于共享脚本的变体。字节级模型通过处理原始UTF-8字符来绕过这一问题,但在非拉丁脚本的词级任务中造成了粒度不匹配。层次字节级架构通过将字节分组为与单词对齐的块来解决这一不匹配。然而,这些架构需要大量训练数据,并且在与冻结的子词基础语言模型配对时会遭遇表示不对齐的问题。本文提出了一种适应性层次网络框架,能够在无需大量训练的情况下弥合这种模态差距。我们的方法直接从冻结基础模型的子词表示初始化字节嵌入,并应用块对齐损失将动态分组的字节块投影到预计算的子词目标上,同时交错轻量级的词性(POS)监督以指导边界检测。实验表明,我们的无分词器方法在六种语言的词级形态学任务中提高了性能,词性标注的提升幅度达到13.3%。

🔬 方法详解

问题定义:本文旨在解决低资源语言处理中的子词分词方法带来的频率模式强加和表示不对齐的问题,尤其是在非拉丁脚本的词级任务中。

核心思路:提出了一种适应性层次网络框架,直接从冻结的子词模型初始化字节嵌入,并通过块对齐损失来动态调整字节块,以更好地对齐到子词目标。

技术框架:整体架构包括字节嵌入初始化、动态字节块分组、块对齐损失计算和词性监督模块。通过这些模块,模型能够在无需大量训练数据的情况下实现有效的低资源语言处理。

关键创新:最重要的创新在于通过直接初始化字节嵌入和应用块对齐损失,成功弥合了字节级模型与子词模型之间的模态差距,避免了对大量训练数据的依赖。

关键设计:在设计中,采用了块对齐损失函数来指导字节块的动态分组,同时引入了轻量级的词性监督,以提高边界检测的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的方法在六种语言的词级形态学任务中显著提高了性能,尤其在词性标注任务中,准确率提升了13.3%。与传统的子词分词方法相比,本文的方法在处理低资源语言时表现出更好的效果,验证了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括低资源语言的自然语言处理任务,如机器翻译、文本分类和信息提取等。通过提高这些语言的处理能力,能够促进多语言环境下的技术普及和文化交流,具有重要的实际价值和社会影响。未来,该方法还可能扩展到其他语言处理任务中,进一步提升低资源语言的研究和应用。

📄 摘要(原文)

Subword tokenization hinders low-resource language processing by imposing frequency patterns from dominant languages onto script-sharing variants. Byte-level models bypass this issue by processing raw UTF-8 characters, yet they create a granularity mismatch for word-level tasks in non-Latin scripts. Hierarchical byte-level architectures address this mismatch by grouping bytes into word-aligned chunks. However, these architectures require massive training data and suffer from representational misalignment when paired with frozen subword-based language models. In this paper, we propose an adapted hierarchical network framework that bridges this modality gap without extensive training. Our method initializes byte embeddings directly from the subword representations of a frozen base model. We apply a chunk alignment loss to project dynamically grouped byte chunks toward precomputed subword targets, and interleave lightweight part-of-speech (POS) supervision to guide boundary detection. Experiments across six languages demonstrate that our tokenizer-free approach improves performance for word-level morphological tasks, yielding up to a 13.3% improvement on POS tagging.