본문으로 건너뛰기

[논문리뷰] UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

링크: 논문 PDF로 바로 열기

메타데이터

저자: Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Sparse MoE (Mixture-of-Experts): 전체 파라미터 중 일부만 활성화하여 계산 효율성을 높이는 구조로, 대규모 추천 모델에서 복잡한 사용자 행동을 처리하기 위해 사용됨.
  • Expert Merging: 사전 학습된 MoE 체크포인트의 다수 전문가를 통합하여, 추론 시 사용할 전문가 수(Expert Budget)를 줄이는 압축 기법.
  • Routing Exposure: 각 전문가가 전체 추천 시스템 트래픽 중 얼마나 많은 양을 처리하는지를 나타내는 지표로, 핵심 전문가의 성능 손실을 방지하는 기준으로 활용됨.
  • Graph Coarsening: 전문가 간의 기능적 유사성을 그래프 구조로 정의하고, 이를 바탕으로 유사한 전문가들을 그룹화하여 파라미터를 통합하는 최적화 프로세스.
  • SwiGLU: 본 논문에서 전문가 계층의 기본 블록으로 사용되는 비선형 활성화 함수를 포함한 feed-forward 구조.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 대규모 추천 모델을 위한 Sparse MoE가 학습된 이후, 실제 배포 단계에서 요구되는 제한된 자원(Expert Budget)에 맞춰 체크포인트를 효율적으로 축소하는 문제인 Expert-budgeted deployment를 해결한다. 기존의 MegaBlocksScatterMoE 같은 기법들은 하드웨어 실행 효율을 개선하지만, 이미 학습된 대규모 전문가 뱅크 자체를 압축하지는 못한다는 한계가 있다. 또한, 단순히 파라미터 간 거리에 기반한 기존 압축 방식은 추천 시스템 특유의 상태 변화에 따른 기능적 유사성과 실제 라우팅 트래픽을 고려하지 못해 성능 저하를 초래한다. 따라서 저자들은 트래픽 기반의 전문가 노출도와 기능적 유사성을 동시에 고려하는 UniMoMo 프레임워크를 제안한다 [Figure 2].

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 UniMoMo를 통해 학습된 MoE 체크포인트를 라우팅 트래픽과 전문가 반응 기반의 그래프 coarsening 과정을 거쳐 압축한다. 제안 방법론은 크게 세 단계로 구성된다: (1) 라우팅 데이터와 전문가 반응을 기록하는 Functional Profiling, (2) 높은 트래픽을 처리하는 전문가를 보호하는 Constrained Graph Coarsening, (3) 비선형 전문가 블록 간의 활성화 불일치를 보정하기 위한 Usage-weighted Reconstruction이다 [Figure 2]. 특히, Least-squares 기반의 보정 연산을 통해 병합된 전문가의 출력 정밀도를 확보하고, 별도의 온라인 모듈 추가 없이 표준 top-k 라우팅을 유지한다. 실험 결과, Amazon Beauty, KuaiRec, TenRec 데이터셋에서 4개 전문가로 압축한 경우 원본 모델 대비 99.92%–102.30%의 NDCG@10 성능을 유지하면서 1.28×–1.63×의 A100 속도 향상을 달성하였다. 더욱 공격적인 2개 전문가 운영 환경에서는 98.36%–104.24%의 성능을 보이면서도 1.47×–2.21×의 Latency 개선을 확인하였다.

4. Conclusion & Impact (결론 및 시사점)

본 논문은 추천 시스템용 MoE 모델의 배포 효율성을 높이기 위한 효과적인 체크포인트 압축 솔루션인 UniMoMo를 성공적으로 제시하였다. 학습 이후 전문가 뱅크를 예산에 맞춰 재구성함으로써, 시스템은 배포 시점에 요구되는 다양한 성능-비용 트레이드오프를 유연하게 선택할 수 있게 되었다. 이 연구는 대규모 추천 모델 운영 시 발생하는 연산 병목 문제를 해결하는 실용적인 경로를 제공하며, 학계뿐만 아니라 실제 산업계의 대규모 추천 시스템 최적화 실무에 크게 기여할 것으로 기대된다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글