Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining
作者: Hai Wang, Chenhao Wang, Qifeng Cai, Yixiu Liu, Miao Peng, Nuo Chen, Yuanlin Tu, Chengcheng Xu, Feng Zhang
分类: cs.CL
发布日期: 2026-08-04
💡 一句话要点
提出可扩展的子文档去重框架以解决大规模预训练中的冗余问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 子文档去重 大规模预训练 自然语言处理 重复内容识别 频率感知策略
📋 核心要点
- 现有的文档级去重方法无法有效处理子文档级的冗余,导致重复内容未被充分去除。
- 本文提出的框架通过自然边界分割和标准化哈希技术,解耦了重复检测与副本保留策略,提升了去重效果。
- 实验结果显示,使用该方法处理的数据训练的模型在FineWeb-Edu和代码包含的网络语料库上表现最佳,提升了整体性能。
📝 摘要(中文)
大规模预训练语料库中存在大量重复内容。尽管文档级去重已被广泛应用,但子文档级冗余的去除仍然具有挑战性。现有的基于后缀数组的方法通常在分片内独立应用,导致跨分片的重复未被检测到,并使得保留行为对分片配置敏感。本文提出了一种可扩展的子文档去重框架,通过自然边界分割、标准化精确哈希和分布式聚合来识别重复组,并应用显式的频率和长度感知保留策略,为每个组分配自适应的副本预算,从而在保留低频或短重复的更多副本的同时,更积极地删除高频或长重复的副本。实验结果表明,使用该方法处理的数据训练的模型在评估设置中表现最佳,强调了显式副本保留控制的重要性。
🔬 方法详解
问题定义:本文旨在解决大规模预训练语料库中的子文档级重复内容去除问题。现有方法在处理跨分片重复时存在局限性,导致冗余内容未被有效识别和去除。
核心思路:提出的框架通过自然边界分割和标准化哈希技术,识别重复组,并采用频率和长度感知的保留策略,以适应不同的重复模式,从而优化副本保留。
技术框架:整体架构包括三个主要模块:自然边界分割用于识别潜在的重复区域,标准化哈希用于精确检测重复,分布式聚合则用于整合各分片的结果。
关键创新:最重要的创新在于解耦了重复检测与副本保留策略,允许根据重复的频率和长度动态调整副本保留策略,与传统的固定保留策略形成鲜明对比。
关键设计:在副本保留策略中,设置了自适应的副本预算,允许对低频或短重复保留更多副本,而对高频或长重复则采取更积极的删除策略。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用本文方法处理的数据训练的模型在FineWeb-Edu和代码包含的网络语料库上表现最佳,相较于基线方法,整体性能提升显著,验证了显式副本保留控制的重要性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的大规模文本预处理、信息检索系统以及任何需要处理大量文本数据的机器学习任务。通过有效去除冗余内容,可以提高模型训练效率,降低计算资源消耗,并提升模型的泛化能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large-scale pretraining corpora contain substantial duplicate content. Although document-level deduplication is widely used, removing subdocument-level redundancy remains challenging. At corpus scale, suffix-array-based methods are commonly applied independently within shards, leaving cross-shard duplicates undetected and making the resulting retention behavior sensitive to the sharding configuration. Hash-based methods enable global exact duplicate counting, but often rely on fixed copy-retention policies that cannot accommodate heterogeneous repetition patterns. We propose a scalable subdocument deduplication framework that decouples duplicate detection from copy retention. It identifies duplicate groups through natural-boundary segmentation, normalized exact hashing, and distributed aggregation, and then applies an explicit frequency- and length-aware retention policy that allocates an adaptive copy budget to each group, retaining more copies of low-frequency or short repetitions while more aggressively deleting high-frequency or long ones. Experiments on FineWeb-Edu and a code-containing web corpus show that models trained on data processed by our method achieve the best overall performance among the evaluated settings. These results underscore the importance of explicit copy-retention control.