[논문리뷰] K-EXAONE 2.0 Technical Report
링크: 논문 PDF로 바로 열기
메타데이터
저자: Eunbi Choi, Kibong Choi, Sehyun Chun, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- MoE (Mixture-of-Experts): 전체 파라미터 중 일부만을 활성화하여 연산 효율성을 극대화하는 아키텍처로, K-EXAONE 2.0은 750B의 거대 파라미터 규모를 유지하면서도 효율적인 추론을 가능하게 함.
- Model Upcycling: 기존 학습된 모델의 가중치를 기반으로 깊이(Depth)와 너비(Width)를 확장하여 지속적으로 학습함으로써, 밑바닥부터 학습하는 비용을 절감하는 기법.
- MTP (Multi-Token Prediction): 모델이 한 번에 여러 개의 토큰을 예측하도록 학습하여 추론 속도를 높이는 모듈.
- DSpark: K-EXAONE 2.0에 새롭게 도입된 semi-autoregressive drafter로, 추론 시 정교한 speculative decoding을 통해 기존 MTP 대비 높은 속도 향상을 제공함.
- SwiGLU: 모델의 활성화 함수로, K-EXAONE 2.0에서는 대규모 학습 안정성을 위해 하위 레이어에서 가중치를 제한(Clamping)하는 기법을 적용함.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 글로벌 AI 경쟁 시대에 대응하여 국산 거대언어모델의 독자적인 구축 및 운영 능력을 확보하기 위해 수행되었다. 기존 모델을 폐기하고 처음부터 모델을 학습시키는 것은 방대한 계산 자원과 데이터, 학습 노하우를 낭비하는 결과를 초래한다. 따라서 저자들은 이전 모델인 K-EXAONE의 자산을 계승하면서도 모델 규모를 3배 이상 확장하고, 실제 현장 배포에 최적화된 성능을 갖춘 차세대 모델을 개발하고자 하였다 [Figure 1].

Figure 1 — K-EXAONE 2.0 주요 평가 결과
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 K-EXAONE 모델의 아키텍처를 깊이와 너비 측면에서 확장하는 Upcycling 방식을 제안한다. 모델은 총 750B 파라미터로 스케일업되었으며, 78개의 레이어와 256개의 전문가(Expert) 그룹을 포함하도록 설계되었다 [Figure 2]. 또한 추론 효율성을 극대화하기 위해 기존 MTP 모듈에 더해 DSpark drafter를 적용하였다. 실험 결과, DSpark를 사용했을 때 기존 MTP 대비 acceptance length가 32~66% 향상되었으며, End-to-End 추론 속도는 최대 2.57배까지 가속화됨을 확인하였다 [Table 2]. 아울러, 256K context window에서의 Needle-in-a-Haystack 테스트 결과, 모든 구간에서 완벽한 정보 복원 성능을 보이며 긴 문맥 이해 능력을 검증하였다 [Figure 5].

Figure 2 — K-EXAONE 2.0 아키텍처 및 모듈

Figure 5 — 256K Long-Context NIAH 결과
4. Conclusion & Impact (결론 및 시사점)
K-EXAONE 2.0은 기존 모델의 학습 자산을 효율적으로 계승하면서도, 모델 규모 확장과 Speculative Decoding 도입을 통해 글로벌 수준의 성능과 실용성을 달성하였다. 이번 연구는 단순한 파라미터 스케일링을 넘어, 추론 속도 최적화, 긴 문맥 처리, 그리고 에이전트 기능을 통합하여 실무 배포 가능한 수준의 파운데이션 모델 개발 방향을 제시했다는 점에서 학계 및 산업계에 큰 의의를 갖는다. 저자들은 본 모델을 Apache 2.0 라이선스로 공개함으로써 국내외 AI 생태계의 기술 발전과 혁신을 도모하고자 한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
Review 의 다른글
- 이전글 [논문리뷰] HelloWorld: Enabling Socially Interactive Characters in Video World Models
- 현재글 : [논문리뷰] K-EXAONE 2.0 Technical Report
- 다음글 [논문리뷰] Lossless Tensor Compression as Program Synthesis
댓글