DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
作者: Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech
分类: cs.CL, cs.AI
发布日期: 2026-08-13
备注: Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model
🔗 代码/项目: HUGGINGFACE
💡 一句话要点
提出Mimir v1以解决开放数据集限制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 层次推理模型 开放数据集 伦理研究 自然语言处理
📋 核心要点
- 现有大型语言模型往往依赖于非许可数据集,限制了开源和伦理研究的可行性。
- Mimir v1采用层次推理模型架构,使用许可的后训练数据进行训练,旨在降低数据获取门槛。
- 在20个基准测试中,Mimir v1在英语和丹麦语的表现超越了多个现有模型,显示出其竞争力。
📝 摘要(中文)
当前大型语言模型的发展依赖于大量非许可数据集,这对致力于开源和伦理数据的研究者构成了高门槛。我们介绍了Mimir v1,这是一种基于层次推理模型(HRM)架构的10亿参数语言模型,完全从头开始训练,并在英语领域表现出色,同时在丹麦语领域设立了新的性能标杆。Mimir v1在161个数据集的混合上进行训练,超越了原始的HRM-Text 1B,并与更大规模的前沿模型如Qwen 3.5 4B和Gemma 4 E2B竞争,在英语、数学与代码及丹麦语的20个基准测试中表现优异。该模型已在Hugging Face Hub上发布。
🔬 方法详解
问题定义:当前大型语言模型的开发面临依赖非许可数据集的问题,这不仅限制了模型的可获取性,也影响了研究的伦理性。
核心思路:Mimir v1通过使用许可的后训练数据,完全从头开始训练,旨在提供一种开放且高效的语言模型解决方案。这样的设计使得模型在遵循伦理标准的同时,仍能保持高性能。
技术框架:Mimir v1基于层次推理模型(HRM)架构,整体流程包括数据收集、模型训练和性能评估。模型训练过程中,采用了161个不同的数据集,以确保多样性和广泛性。
关键创新:Mimir v1的主要创新在于其使用的许可后训练数据,这与传统依赖非许可数据集的模型形成了鲜明对比,使得模型的开发更加符合伦理标准。
关键设计:在模型设计中,Mimir v1采用了10亿参数的架构,结合了先进的损失函数和优化算法,以确保在多种语言任务中的优越表现。
🖼️ 关键图片
📊 实验亮点
Mimir v1在20个基准测试中表现优异,尤其在丹麦语领域设立了新的性能标杆。与原始HRM-Text 1B相比,Mimir v1的性能显著提升,并与更大规模的模型如Qwen 3.5 4B和Gemma 4 E2B相竞争,展示了其强大的能力。
🎯 应用场景
Mimir v1的研究成果在多个领域具有广泛的应用潜力,包括自然语言处理、机器翻译和教育技术等。其开放的训练数据策略为研究者提供了新的思路,促进了伦理数据使用的实践,未来可能推动更多开源项目的发展。
📄 摘要(原文)
Current large language model development relies on massive, often non-permissible datasets, creating a high barrier for researchers committed to open-source and ethically sourced data. We introduce Mimir v1, a 1-billion-parameter language model based on the Hierarchical Reasoning Model (HRM) architecture, that is trained from scratch and delivers highly competitive performance for English and sets a new state of the art for Danish using only permissible post-training data. Trained on a mixture of 161 datasets, Mimir v1 outperforms the original HRM-Text 1B and competes with larger frontier models like Qwen 3.5 4B and Gemma 4 E2B, tested across 20 benchmarks for English, Math & Code and Danish. The model is available on the Hugging Face Hub: https://huggingface.co/danish-foundation-models/DFM-Mimir