SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

📄 arXiv: 2608.06179v1 📥 PDF

作者: Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

分类: cs.LG

发布日期: 2026-08-06

备注: 18 pages, 7 figures


💡 一句话要点

提出SAGA框架以解决低资源北欧语言模型的偏好优化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 偏好优化 低资源语言 依赖解析器 自然语言处理 生成模型 语法对齐 机器学习

📋 核心要点

  1. 现有的偏好优化方法依赖于人类标注,成本高且在低资源语言中难以获取。
  2. SAGA框架通过依赖解析器的监督,替代人类偏好标注,优化生成模型的输出质量。
  3. 实验结果显示,SAGA在多种北欧语言中显著提升了语法质量,且无需人类偏好标签。

📝 摘要(中文)

偏好优化已被证明能有效提升大型语言模型的性能,但通常依赖于昂贵的人类偏好标注。将这些方法扩展到形态丰富、资源稀缺的语言面临挑战,因为此类标注稀缺。本文提出SAGA(基于分数加权的自适应生成对齐),一种通过依赖解析器监督替代人类标签的偏好优化框架。SAGA将解析器判断转换为偏好对,结合解析器质量与词汇多样性形成复合奖励,利用奖励差距标准过滤低信息对,并监控奖励操控以保持可靠的监督。在使用GPT-SW3-1.3B的丹麦语、冰岛语和挪威博克马尔语中,SAGA在不需要人类偏好标签的情况下,持续提高了语法质量。

🔬 方法详解

问题定义:本研究旨在解决在低资源北欧语言中,偏好优化方法依赖人类标注的高成本问题。现有方法在这些语言中难以实施,导致模型性能受限。

核心思路:SAGA框架通过依赖解析器的监督,替代人类偏好标注,利用解析器的判断生成偏好对,从而实现偏好优化。此设计旨在提高模型的生成质量,同时降低对人类标注的依赖。

技术框架:SAGA的整体架构包括几个主要模块:首先,解析器生成的判断被转换为偏好对;其次,结合解析器质量与词汇多样性形成复合奖励;然后,利用奖励差距标准过滤低信息对;最后,监控奖励操控以确保监督的可靠性。

关键创新:SAGA的主要创新在于使用解析器生成的监督信息替代人类偏好标注,这在低资源语言中提供了一种实用的替代方案,显著提高了模型的语法对齐能力。

关键设计:在设计中,SAGA采用了复合奖励机制,结合了解析器的准确性和生成文本的多样性。此外,奖励差距标准用于过滤低信息对,确保模型训练的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SAGA在丹麦语的解析成功率从69.0%提升至93.8%,冰岛语在独立评估中提高了4.5个百分点,挪威博克马尔语提升了28个百分点。此外,80%的母语者在对比中偏好SAGA的输出,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括低资源语言的自然语言处理任务,如机器翻译、文本生成和语法检查等。通过提供一种无需人类偏好标注的优化方法,SAGA能够在资源有限的情况下提升模型性能,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Preference optimisation has proven effective for improving large language models but typically relies on costly human preference annotations. Extending these methods to morphologically rich, low-resource languages remains challenging because such annotations are scarce. We present SAGA (Score-weighted Adaptive Generation Alignment), a parser-guided preference optimisation framework that replaces human labels with dependency-parser supervision. SAGA converts parser judgements into preference pairs for delta-DPO, combines parser quality with lexical diversity in a composite reward, filters low-information pairs using a reward-gap criterion, and monitors reward hacking to maintain reliable supervision. Across Danish, Icelandic, and Norwegian Bokmål using GPT-SW3-1.3B, SAGA consistently improves grammatical quality without requiring human preference labels. Danish parse success increases from 69.0% to 93.8%, Icelandic achieves a +4.5 percentage-point improvement on an independent Stanza evaluation (three-run mean +3.3 percentage points) while native speakers prefer SAGA outputs in 80% of pairwise comparisons, and Norwegian Bokmål improves by +28 percentage points. These results demonstrate that parser-derived supervision is a practical alternative to human preference annotation for grammatical alignment in low-resource languages where high-quality dependency parsers are available.