K-EXAONE 2.0 Technical Report
作者: Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon
分类: cs.CL
发布日期: 2026-08-05
💡 一句话要点
提出K-EXAONE 2.0以提升多语言模型能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多语言模型 混合专家 长文本理解 推理能力 安全性
📋 核心要点
- 现有多语言模型在参数效率和上下文理解能力上存在不足,难以满足实际应用需求。
- K-EXAONE 2.0通过扩展架构和采用混合专家模型,显著提升了模型的参数容量和多语言支持能力。
- 在多个评估类别中,K-EXAONE 2.0相较于前代模型有显著提升,尤其在长上下文理解和安全性方面表现突出。
📝 摘要(中文)
本技术报告介绍了K-EXAONE 2.0,这是LG AI研究所开发的开放权重多语言基础模型,旨在推动全球前沿基础模型的发展。K-EXAONE 2.0在原有模型的基础上进行了架构扩展,采用混合专家(MoE)模型,参数总量达到750B,每个token激活约37B,超过前代模型三倍。该模型支持最长256K token的上下文长度,并将多语言覆盖范围从六种扩展至十种。其训练流程结合了持续预训练、聚焦难度的中期训练和后期训练,增强了推理能力、代理编码、多语言能力及基于韩国社会文化背景的安全性。在九个评估类别中,K-EXAONE 2.0在代理编码和长上下文理解上表现出显著提升,并在长上下文检索和安全性方面展现出明显优势。
🔬 方法详解
问题定义:本研究旨在解决现有多语言模型在参数效率和上下文理解能力上的不足,尤其是在处理长文本和多语言支持时的挑战。
核心思路:K-EXAONE 2.0通过扩展原有模型架构,采用混合专家(MoE)设计,旨在提高模型的参数利用率和多语言处理能力。这样的设计使得模型在处理复杂任务时能够激活更多的参数,从而提升性能。
技术框架:K-EXAONE 2.0的整体架构包括持续预训练、难度聚焦的中期训练和后期训练三个主要阶段。持续预训练为模型提供基础知识,中期训练则针对特定任务进行优化,后期训练则确保模型在实际应用中的安全性和可靠性。
关键创新:K-EXAONE 2.0的最大创新在于其混合专家架构,允许在每次推理中激活不同的参数子集,从而实现更高的计算效率和更强的模型能力。这一设计与传统的全参数模型形成鲜明对比。
关键设计:模型的参数设置为750B,总体激活参数约为37B,支持最长256K token的上下文长度。此外,训练过程中采用了针对性损失函数,以增强模型在多语言和长上下文任务中的表现。具体的网络结构细节和参数设置在报告中有详细描述。
🖼️ 关键图片
📊 实验亮点
K-EXAONE 2.0在九个评估类别中表现优异,尤其在代理编码和长上下文理解方面,显示出显著的性能提升。与前代模型相比,其在长上下文检索和安全性方面的优势尤为明显,证明了其在实际应用中的竞争力。
🎯 应用场景
K-EXAONE 2.0的潜在应用领域包括多语言翻译、跨文化信息检索和长文本理解等。其增强的推理能力和安全性使其在实际应用中更具价值,能够为全球用户提供更精准的服务。未来,该模型有望推动多语言AI系统的发展,促进不同文化间的交流与理解。
📄 摘要(原文)
This technical report presents K-EXAONE 2.0, an open-weight multilingual foundation model developed by LG AI Research as a step in our effort toward global frontier-scale foundation models. Rather than training from scratch, we upcycle K-EXAONE and expand its architecture, yielding a Mixture-of-Experts (MoE) model with 750B total parameters and approximately 37B activated per token---more than three times the capacity of its predecessor. K-EXAONE 2.0 supports context lengths of up to 256K tokens and expands multilingual coverage from six to ten languages. Its training pipeline combines continual pre-training, difficulty-focused mid-training, and post-training to strengthen reasoning, agentic coding, multilingual capability, and safety grounded in Korean sociocultural contexts. Across nine evaluation categories selected to reflect the conditions of practical use, K-EXAONE 2.0 improves over K-EXAONE and remains competitive with open-weight models, showing its largest gains in agentic coding and long-context understanding and its clearest strengths in long-context retrieval and safety. Released under the Apache 2.0 license, K-EXAONE 2.0 enables the wider AI ecosystem to evaluate, deploy, adapt, and build upon it, while marking the beginning---rather than the endpoint---of our challenge toward the global frontier.