[논문리뷰] Expert-Space Exploration in MoE Reinforcement Learning본 논문은 기존의 LLM post-training 연구가 token-level의 sampling에만 집중하고, MoE 모델의 핵심인 expert routing의 다양성 활용에는 소홀했다는 점을 지적하며 ESRL을 제안합니다.#Review#MoE#Reinforcement Learning#Expert Routing#Exploration#Rollout Routing Replay2026년 9월 14일댓글 수 로딩 중
[논문리뷰] Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert modelsMoE(Mixture-of-Experts) 모델이 배포 시 발생하는 분포 변화(distribution shifts) 로 인해 차선적인 라우팅 결정(suboptimal routing decisions) 을 겪는 문제를 해결하는 것이 목표입니다.#Review#Mixture-of-Experts (MoE)#Online Adaptation#Test-Time Adaptation (TTA)#Expert Routing#Large Language Models (LLMs)#Self-Supervision#Computational Efficiency#Context Shift Robustness2025년 10월 20일댓글 수 로딩 중