[논문리뷰] Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts본 논문은 대규모 MoE 모델 훈련 시 필수적인 하이퍼파라미터, 특히 Learning Rate 최적화의 높은 비용과 복잡성 문제를 해결합니다. 기존의 2D 하이퍼파라미터 스윕(모델 규모 및 토큰 수 탐색)은 모델이 커질수록 계산 비용이 기하급수적으로 증가하여 실행 불가능한 수준입니다 .#Review#Mixture-of-Experts#Hyperparameter Transfer#Maximal Update Parameterization#Scaling Laws#Foundation Model2026년 8월 23일댓글 수 로딩 중