[논문리뷰] FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video GenerationVideo Diffusion Transformers(Video DiTs)는 고해상도 및 장기 비디오 생성 시 발생하는 막대한 Attention 연산 비용이 추론의 주된 병목 현상으로 작용합니다.#Review#Video Diffusion Transformers#Adaptive Sparse Attention#Runtime Load Balancing#Ulysses#Sequence Parallelism#P2P Communication#Slack-Aware Sparse Augmentation2026년 7월 22일댓글 수 로딩 중
[sglang] [HunyuanVideo] Sequence Parallelism 최적화: Text Token Sharding으로 성능 한계 돌파하기HunyuanVideo 모델에서 텍스트 토큰을 분산 처리하여 중복 연산을 제거하고 추론 속도를 최대 5.7% 향상시킨 기법을 분석합니다.#SGLang#HunyuanVideo#Sequence Parallelism#DeepSpeed Ulysses#Distributed Computing2026년 6월 20일댓글 수 로딩 중
[논문리뷰] OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning본 논문은 기존 Diffusion Transformers(DiTs) 기반 비디오 생성 모델이 가진 2차 복잡도의 연산 비용 문제를 해결하고, 고해상도 비디오 생성 효율을 높이는 것을 목표로 한다.#Review#Video Generation#Diffusion Transformers#Sparse Attention#Sequence Parallelism#Quantization#Reinforcement Learning2026년 5월 27일댓글 수 로딩 중
[논문리뷰] LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation본 논문은 긴 비디오 생성 시 발생하는 메모리 병목 현상과 낮은 연산 효율 문제를 해결하기 위해 시스템과 알고리즘이 통합된 인프라 LongLive-2.0을 제안한다.#Review#Long Video Generation#NVFP4#Sequence Parallelism#Autoregressive Diffusion#KV Cache Quantization#Balanced SP2026년 5월 18일댓글 수 로딩 중
[논문리뷰] VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo본 논문은 다양한 모달리티를 처리하는 복잡하고 이질적인 아키텍처 때문에 확장성이 부족하고 엔지니어링 오버헤드가 큰 옴니모달 LLM(Large Language Models) 훈련의 어려움을 해결하는 것을 목표로 합니다.#Review#Omni-modal LLMs#Distributed Training#Model-centric#Parallelism#FSDP#Sequence Parallelism#Expert Parallelism#Mixture-of-Experts2025년 8월 5일댓글 수 로딩 중