Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
作者: Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
分类: cs.AI
发布日期: 2026-08-14
💡 一句话要点
提出Mobius架构以提升知识压缩与推理效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 知识压缩 推理效率 Mobius架构 组合推理 深度学习 自然语言处理 模型训练 端到端推理
📋 核心要点
- 现有方法在知识存储和推理效率上存在不足,难以实现高效的组合推理。
- 论文提出的Mobius架构通过分离知识存储与推理过程,提高了知识压缩和推理效率。
- 实验结果表明,7B模型在数据量减少的情况下仍能达到与基线相似的性能,同时Intern-S2-Mobius实现了显著的推理速度提升。
📝 摘要(中文)
我们介绍了Mobius-v0架构,该架构包含一个全球共享的内存(FFN)用于存储知识向量,以及多个推理器(Self-Attn)用于迭代实现组合推理。推理器利用隐藏状态作为缓存和载体,反复查询内存以获取所需的知识向量,同时知识被传递回推理操作。通过这种知识与推理分离的架构,Mobius在知识压缩和推理效率上取得了更好的效果。在Mobius-v0架构的基础上,我们的7B模型从零开始训练,使用62.6%的基线训练数据达到了与7B Transformer基线相似的下游得分。此外,我们的Intern-S2-Mobius在Qwen3.5-35B的持续预训练下,达到了相似的下游得分,同时实现了近4倍的端到端推理速度提升。
🔬 方法详解
问题定义:本论文旨在解决现有模型在知识存储与推理效率上的不足,尤其是在组合推理任务中的表现不佳。现有方法往往难以有效整合知识,导致推理过程缓慢且效率低下。
核心思路:论文提出的Mobius架构通过将知识存储与推理过程分离,利用共享内存和多个推理器的组合,提升了知识的压缩能力和推理的效率。这种设计使得推理器能够高效地查询和利用知识向量。
技术框架:Mobius架构主要由一个全球共享的内存模块(FFN)和多个推理器(Self-Attn)组成。内存模块存储知识向量,推理器则通过迭代查询内存来实现组合推理。推理器使用隐藏状态作为缓存,确保信息的高效传递。
关键创新:Mobius架构的核心创新在于知识与推理的分离设计,这一设计使得模型在知识压缩和推理效率上显著优于传统方法。与现有方法相比,Mobius能够更好地处理复杂的推理任务。
关键设计:在模型设计中,采用了7B参数的结构,并通过从零开始训练来优化性能。此外,模型在训练过程中使用了62.6%的基线数据,确保了在数据利用率上的高效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,7B模型在使用62.6%训练数据的情况下,达到了与7B Transformer基线相似的下游得分。此外,Intern-S2-Mobius在Qwen3.5-35B的持续预训练下,成功实现了近4倍的端到端推理速度提升,展现了显著的性能优势。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能问答系统和复杂推理任务等。通过提升知识压缩与推理效率,Mobius架构能够在多种场景中实现更快速、更准确的决策支持,具有广泛的实际价值和未来影响。
📄 摘要(原文)
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.