[논문리뷰] LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models본 논문은 대규모 MoE 기반 dLLM의 최적 Scaling 행동과 아키텍처 설계 원칙이 기존 AR 모델과는 다르다는 점을 지적하며, 이를 체계적으로 정립하고자 합니다.#Review#Diffusion Language Models#Mixture-of-Experts#Scaling Laws#Compute-Optimal#LLaDA#Sparse Activation2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers본 논문은 Token-intensive 환경에서 고해상도 이미지 및 긴 영상 데이터를 처리할 때 발생하는 Diffusion Transformer의 연산 및 메모리 비효율 문제를 해결하고자 한다. 기존의 Full Attention 구조는 시퀀스 길이에 따라 연산 비용이 제곱으로 증가하여 확장성에 한계가 있다.#Review#Diffusion Transformers#Hybrid Attention#Chinchilla Scaling#Mixture-of-Experts#Compute-Optimal#HeteroP2026년 7월 30일댓글 수 로딩 중