본문으로 건너뛰기

[논문리뷰] SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

링크: 논문 PDF로 바로 열기

저자: Dongfang Li, Xiaodong Luo, Ruoyu Sun, et al.

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • SLAI T-Rex: Ascend SuperPOD 인프라에서 최적화된 full-parameter post-training을 수행하고, OR(Operations Research) 도메인에 특화된 CPT-SFT 워크플로우를 결합한 통합 프레임워크입니다.
  • AuraKernel: Ascend NPU 환경에서 OR 기반 최적화 솔버를 활용하여 병목 현상을 겪는 커널의 tiling, 데이터 레이아웃, 파이프라인 스케줄링을 자동으로 최적화하는 에이전트입니다.
  • MFU (Model FLOPs Utilization): 하드웨어의 연산 성능 대비 실제 모델 학습에 활용된 FLOPs의 비율로, 본 연구의 시스템 효율성 지표입니다.
  • CPT (Continued Pre-Training): 특정 도메인의 지식과 모델링 priors를 습득하기 위한 사전 학습 단계입니다.
  • SFT (Supervised Fine-Tuning): 특정 작업에 대한 모델의 행동(behavior)을 정렬하고 명령 이행 능력을 강화하는 지도 학습 단계입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 trillion-parameter 규모의 MoE 모델인 DeepSeek-V4를 Ascend SuperPOD 클러스터에서 학습할 때 발생하는 시스템적 병목 현상을 해결하고자 합니다. 기존 LLM 학습 시스템은 주로 GPU 클러스터에 최적화되어 있어, SIMD 기반의 Ascend NPU 환경에서의 대규모 학습에 대한 체계적인 최적화 연구가 부족했습니다. 특히 연산-통신 불균형, 메모리 압박, 커널 조각화(fragmentation) 문제를 극복해야 하는 과제가 있습니다. 또한, Operations Research(OR) 도메인에서의 복잡한 구조적 모델링 요구사항을 LLM이 정확히 이행하지 못하는 문제를 해결하는 것이 핵심입니다.

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 저자들은 연산, 통신, 메모리 계층 전반을 아우르는 계층적 최적화 프레임워크를 개발하고, AuraKernel을 도입하여 연산 병목 커널을 자동 최적화합니다. [Figure 1]에서 확인할 수 있듯이, 이러한 하드웨어 최적화 전략을 통해 baseline 대비 MFU11.67%에서 34.22%2.93배 향상시켰습니다. 또한, OR 도메인 특화 성능 향상을 위해 10K 규모의 solver-verified synthetic 데이터를 생성하여 CPTSFT를 결합한 파이프라인을 구축했습니다. 실험 결과, CPT+SFT를 적용한 DeepSeek-V4-Flash 모델은 B4O-ORGEval 벤치마크에서 기존 SFT 대비 큰 폭의 성능 개선을 보이며, 평균 정확도 71.81%GPT-5.4-Mini 모델보다 3.98%p 높은 성능을 달성했습니다. [Table 13]에 따르면, 통합 파이프라인은 0-shot Pass@1 환경에서 모든 OR 벤치마크 데이터셋에 대해 가장 우수한 성능을 기록하였습니다.

Figure 1: 시스템 최적화 결과인 MFU 개선 수치를 보여주는 핵심 그래프

Figure 1 — 시스템 최적화 결과인 MFU 개선 수치를 보여주는 핵심 그래프

Table 13: 최종 모델 파이프라인의 성능 우위성을 증명하는 결과 테이블

Table 13 — 최종 모델 파이프라인의 성능 우위성을 증명하는 결과 테이블

## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 Ascend NPU 인프라에서 trillion-parameter급 모델의 효율적인 full-parameter 학습이 가능함을 실증적으로 입증하였습니다. SLAI T-Rex는 하드웨어 인프라 최적화와 도메인 특화 post-training이라는 두 축을 통해 모델 성능을 극대화하는 성공적인 모델을 제시합니다. 이러한 접근법은 특정 하드웨어 환경에 종속되지 않는 대규모 AI 시스템 구축의 가이드라인을 제공하며, 복잡한 추론이 필요한 산업 도메인에서 도메인 적응 모델링의 표준적인 방법론이 될 것으로 기대됩니다.


⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글