[sglang] Cosmos3 T2I 가속화: QKNorm + RoPE 커널 퓨전과 BF16 정밀도 최적화Cosmos3 모델의 T2I 경로에서 개별적으로 실행되던 QKNorm, RoPE, KV-packing을 하나의 커널로 통합하고, BF16 라운딩 처리를 통해 성능과 정확도를 동시에 잡은 최적화 사례입니다.#CUDA#PyTorch#Kernel-Fusion#Diffusion#SGLang2026년 8월 16일댓글 수 로딩 중
[sglang] [AMD] Triton 커널 퓨전을 통한 Qwen3.5 MoE 라우팅 최적화 분석4개의 커널 호출을 단일 Triton 커널로 통합하여 Qwen3.5 MoE 모델의 서빙 성능을 최대 4.16% 향상시킨 최적화 기법을 살펴봅니다.#Triton#MoE#Qwen3.5#Kernel-Fusion#SGLang#AMD2026년 4월 15일댓글 수 로딩 중