[논문리뷰] LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models본 논문은 대규모 MoE 기반 dLLM의 최적 Scaling 행동과 아키텍처 설계 원칙이 기존 AR 모델과는 다르다는 점을 지적하며, 이를 체계적으로 정립하고자 합니다.#Review#Diffusion Language Models#Mixture-of-Experts#Scaling Laws#Compute-Optimal#LLaDA#Sparse Activation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation본 논문은 '모든 활성화가 추론 능력을 향상시킨다'는 원칙 아래, 1조 개의 파라미터를 가진 추론 중심의 개방형 언어 파운데이션 모델(Ling 2.0) 을 개발하는 것을 목표로 합니다.#Review#Large Language Models#Mixture-of-Experts#Reasoning Capability#Sparse Activation#Scaling Laws#FP8 Training#Efficient Training#Instruction Tuning2025년 11월 9일댓글 수 로딩 중