[sglang] MiniMax-H3 모델의 AdaLN 추론 최적화: Pinned-Host 캐싱과 LRU 전략MiniMax-H3 모델의 AdaLN 재구축 비용을 획기적으로 줄이는 Pinned-Host 캐싱 및 LRU 기법 도입#SGLang#Diffusion#Optimization#Caching#MiniMax-H32026년 9월 3일댓글 수 로딩 중
[sglang] MiniMax-H3 모델을 24GB GPU에서 가속화하는 INT8 양자화 및 플러그형 어텐션 최적화MiniMax-H3 모델을 24GB GPU에서 실행하기 위해 INT8 양자화와 플러그형 어텐션 백엔드를 도입하여 최대 2.48배 성능을 향상했습니다.#SGLang#Diffusion#Optimization#INT8#GPU2026년 8월 18일댓글 수 로딩 중
[sglang] Cosmos3 T2I 가속화: QKNorm + RoPE 커널 퓨전과 BF16 정밀도 최적화Cosmos3 모델의 T2I 경로에서 개별적으로 실행되던 QKNorm, RoPE, KV-packing을 하나의 커널로 통합하고, BF16 라운딩 처리를 통해 성능과 정확도를 동시에 잡은 최적화 사례입니다.#CUDA#PyTorch#Kernel-Fusion#Diffusion#SGLang2026년 8월 16일댓글 수 로딩 중
[sglang] SGLang의 Wan2.2-TI2V 최적화: Triton 커널을 통한 메모리 트래픽 병목 해결Wan2.2-TI2V 모델의 per-token adaLN 연산을 Triton 커널로 융합하여 메모리 복사를 제거하고 성능을 13% 향상시켰습니다.#SGLang#Triton#Diffusion#Optimization#GPU2026년 8월 13일댓글 수 로딩 중
[sglang] [Diffusion] Qwen 모델의 Varlen Mask 메타데이터 호스트 측 빌드 최적화Qwen Diffusion 모델에서 GPU 동기화를 유발하던 Varlen Mask 메타데이터 생성을 호스트 측으로 옮겨 성능을 개선합니다.#SGLang#Diffusion#Performance Optimization#PyTorch#Varlen Attention#Qwen2026년 8월 7일댓글 수 로딩 중
[sglang] FLUX.2 모델의 추론 속도 향상: Residual-Gate 커널 최적화FLUX.2 모델의 residual-gate 연산을 전용 CUDA 커널로 통합하여 추론 속도를 약 1.2% 개선했습니다.#SGLang#FLUX.2#CUDA#Optimization#Diffusion2026년 8월 6일댓글 수 로딩 중
[sglang] SGLang: Wan VAE의 RMSNorm 및 SiLU 연산 융합을 통한 추론 가속Wan VAE의 RMSNorm과 SiLU 연산을 Triton 커널로 융합하여 DecodingStage 성능을 최대 11.5% 개선했습니다.#SGLang#Triton#Optimization#Diffusion#VAE2026년 8월 5일댓글 수 로딩 중
[sglang] Diffusion DiT 모델의 FFN 성능 최적화: cublasLt GELU Epilogue 융합Diffusion DiT 모델의 FFN 연산에서 GEMM과 GELU를 융합하여 커널 호출 오버헤드를 줄이고 HBM 접근을 최적화했습니다.#Diffusion#CUDA#Optimization#SGLang#Performance2026년 8월 4일댓글 수 로딩 중
[논문리뷰] Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding본 논문은 기존의 엄격한 순차적 Autoregressive (AR) 디코딩 방식이 가진 낮은 추론 병렬성과 자원 활용도 문제를 해결하기 위해 고안되었습니다.#Review#Language Model#Autoregressive#Diffusion#Self-Speculation#Parallel Decoding#Inference Efficiency#Tri-Mode Decoding2026년 7월 7일댓글 수 로딩 중
[sglang] [SGLang] VAE 병렬 디코딩 최적화: CFG 병렬화와의 시너지 분석SGLang에서 CFG 병렬화 시 VAE 디코딩을 모든 Rank가 참여하도록 개선하여 디코딩 속도를 31% 향상시킨 사례를 분석합니다.#Diffusion#SGLang#VAE#Parallel Computing#Optimization2026년 6월 13일댓글 수 로딩 중
[sglang] SGLang Diffusion 모델의 FP8 GEMM 최적화: 41.5% 성능 향상 달성Ideogram4 모델의 FP8 weight-only linear 연산을 Fused W8A8 FP8 GEMM으로 교체하여 추론 속도를 1.7배 개선했습니다.#SGLang#Diffusion#FP8#GEMM#Optimization#CUDA2026년 6월 11일댓글 수 로딩 중
[sglang] SGLang의 Spectral Progressive Diffusion 도입: 추론 속도 최대 2.78배 향상Transformer의 O(n²) 연산 비용을 혁신적으로 줄이는 Spectral Progressive Diffusion 기술 분석#SGLang#Diffusion#Optimization#Transformer#GPU2026년 6월 8일댓글 수 로딩 중
[sglang] SGLang의 Ideogram4 추론 성능 최적화: Denoising 루프 내 오버헤드 제거Ideogram4 모델의 Denoising 루프에서 반복적으로 수행되던 마스크 메타데이터 생성 및 스케줄 계산을 사전 연산으로 최적화하여 성능을 개선했습니다.#SGLang#Diffusion#Optimization#Performance#Ideogram42026년 6월 7일댓글 수 로딩 중
[sglang] [SGLang] LingBot 실시간 서빙 최적화: 카메라 컨디셔닝 캐싱과 전송 프로토콜 개선LingBot의 실시간 지연시간을 10% 이상 단축시킨 카메라 컨디셔닝 캐싱 및 전송 레이어 최적화 기법을 살펴봅니다.#SGLang#Diffusion#Optimization#Realtime#PyTorch#Performance2026년 6월 5일댓글 수 로딩 중
[sglang] [SGLang] Blackwell(B200)에서 Diffusion Attention 성능을 7배 끌어올리는 Triton 커널 최적화 분석PyTorch SDPA의 마스크 처리 한계를 Triton 커널 퓨전과 Varlen FlashAttention으로 극복하여 B200에서 최대 21%의 성능 향상을 달성했습니다.#Triton#FlashAttention#Diffusion#CUDA#Performance Optimization#SGLang2026년 5월 28일댓글 수 로딩 중
[sglang] SGLang Diffusion 최적화: CFG Gating을 통한 추론 속도 20% 향상Classifier-free guidance(CFG)의 불필요한 연산을 줄이는 CFG Gating 기법을 도입하여 Denoising 단계의 성능을 25% 개선했습니다.#SGLang#Diffusion#Optimization#LLM#Inference2026년 5월 25일댓글 수 로딩 중
[논문리뷰] Fast Byte Latent Transformer본 논문은 byte-level language model이 지닌 고질적인 추론 속도 문제를 해결하는 것을 목적으로 한다. 기존의 바이트 단위 모델은 Subword 모델과 달리 입력 길이가 훨씬 길어지기 때문에, Naive한 자기회귀(Autoregressive) 방식으로는 매우 느린 추론 속도를 보인다는 한계가 있다.#Review#Byte-level Language Model#BLT#Diffusion#Inference Acceleration#Speculative Decoding#Latent Tokenization2026년 5월 10일댓글 수 로딩 중
[sglang] SGLang Diffusion 모델의 NVFP4 추론 성능 최적화: CUTLASS 도입Diffusion 모델의 NVFP4 연산 기본 백엔드를 CUTLASS로 전환하여 성능을 대폭 개선하고 벤치마크를 추가했습니다.#SGLang#Diffusion#NVFP4#CUTLASS#Performance2026년 4월 4일댓글 수 로딩 중
[sglang] Diffusion 모델용 Fused QKNorm+RoPE CUDA 커널 추가SGLang에 Diffusion 모델의 QKNorm과 RoPE를 하나의 CUDA 커널로 융합하여 메모리 접근을 절반으로 줄이는 warp-level 최적화 커널 분석.#SGLang#CUDA#Diffusion#RoPE#RMSNorm#Kernel Fusion#GPU Optimization2026년 3월 27일댓글 수 로딩 중
[sglang] QKNorm Across Heads CUDA 커널 최적화: Q/K 분리로 레지스터 압력 해소SGLang의 qknorm_across_heads CUDA 커널에서 Q와 K를 하나의 블록에서 동시 처리하던 방식을 2D grid로 분리하여 레지스터 사용량과 shared memory를 절반으로 줄인 최적화 분석.#SGLang#CUDA#Kernel Optimization#RMSNorm#Diffusion#GPU2026년 3월 27일댓글 수 로딩 중
[SGLang] Diffusion Triton Rotary Embedding 다중 헤드 병렬 처리 최적화Triton rotary embedding 커널을 토큰당 여러 헤드를 동시에 처리하도록 재구성하여 커널 launch 횟수를 줄인다#SGLang#Triton#Diffusion#Rotary Embedding2026년 3월 26일댓글 수 로딩 중