[논문리뷰] Flattening Every Memory Peak in Long-Context Mixture-of-Experts Training본 연구는 Long-Context 환경에서 MoE 모델을 학습할 때 발생하는 Memory Peak 현상이 모델 확장성을 심각하게 저해하는 문제를 해결하고자 합니다.#Review#Mixture-of-Experts#Long-Context#Memory Optimization#Activation Checkpointing#Gradient Sharding#Training Efficiency2026년 9월 16일댓글 수 로딩 중