[sglang] Cosmos3 T2I 가속화: QKNorm + RoPE 커널 퓨전과 BF16 정밀도 최적화Cosmos3 모델의 T2I 경로에서 개별적으로 실행되던 QKNorm, RoPE, KV-packing을 하나의 커널로 통합하고, BF16 라운딩 처리를 통해 성능과 정확도를 동시에 잡은 최적화 사례입니다.#CUDA#PyTorch#Kernel-Fusion#Diffusion#SGLang2026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V4 사전 생성 처리량 향상을 위한 Sparse Top-K 메타데이터 커널 최적화vLLM의 DeepSeek-V4 모델에서 사전 생성 처리량을 높이기 위해 Sparse Top-K 메타데이터 커널을 최적화했습니다.#vLLM#성능 최적화#딥러닝#LLM#DeepSeek-V42026년 8월 16일댓글 수 로딩 중
[sglang] SGLang의 MoE Top-K Softmax 커널: AOT에서 JIT로의 효율적인 전환SGLang의 moe_topk_softmax 커널을 AOT에서 JIT 방식으로 전환하여 휠 사이즈를 줄이고 유연성을 확보한 최적화 사례를 분석합니다.#SGLang#CUDA#JIT#MoE#Optimization2026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V3.2/GLM-5.2 MTP 경로 최적화: All-Reduce 융합 및 로컬 Argmax 도입vLLM에서 DeepSeek-V3.2/GLM-5.2 모델의 MTP 경로 성능을 향상시키는 두 가지 최적화 기법을 소개합니다.#vLLM#성능 최적화#딥러닝#LLM#MTP#DeepSeek#GLM2026년 8월 15일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA ArgMax/ArgMin 연산 최적화: 대규모 행렬 병렬 처리 개선단일 스레드 기반의 ArgMax/ArgMin 연산을 협력적 병렬 처리로 개선하여 대규모 행렬에서 최대 1000배 이상의 성능 향상을 달성했습니다.#CUDA#ONNX Runtime#GPU Optimization#Performance#Parallel Computing2026년 8월 15일댓글 수 로딩 중
[vllm] vLLM, Cohere 임베딩 바이너리 압축 성능 4배 개선: NumPy를 활용한 최적화 분석vLLM에서 Cohere 바이너리 임베딩의 비트 압축 로직을 NumPy로 개선하여 성능을 4배 향상시킨 PR을 분석합니다.#vLLM#성능 최적화#NumPy#임베딩#Python2026년 8월 14일댓글 수 로딩 중
[sglang] [MoE] SwiGLU 퓨전: Triton 커널 최적화로 메모리 대역폭 한계 돌파하기MoE 레이어의 up-GEMM과 활성화 함수를 하나로 합쳐 메모리 오버헤드를 줄이고 추론 속도를 개선한 기법을 분석합니다.#MoE#Triton#CUDA#LLM Optimization#SGLang2026년 8월 14일댓글 수 로딩 중
[sglang] AMD MI355X 환경에서 Triton 3.7 레지스터 스필링 최적화Triton 3.7 도입 후 발생한 gfx950 아키텍처의 레지스터 스필링 문제를 BLOCK_N 최적화를 통해 해결하고 성능을 58% 개선했습니다.#SGLang#Triton#AMD#GPU#Optimization2026년 8월 14일댓글 수 로딩 중
[flashinfer] Gemma-4를 위한 Blackwell 최적화: FlashInfer의 비대칭 VO-Split NVFP4 구현 분석Gemma-4의 비대칭 헤드 구조(QK=512, VO=256)를 Blackwell GPU에서 NVFP4 KV 캐시로 최적화하는 과정을 살펴봅니다.#FlashInfer#Blackwell#NVFP4#Gemma-4#CUDA#LLM Inference2026년 8월 13일댓글 수 로딩 중
[sglang] SGLang의 Wan2.2-TI2V 최적화: Triton 커널을 통한 메모리 트래픽 병목 해결Wan2.2-TI2V 모델의 per-token adaLN 연산을 Triton 커널로 융합하여 메모리 복사를 제거하고 성능을 13% 향상시켰습니다.#SGLang#Triton#Diffusion#Optimization#GPU2026년 8월 13일댓글 수 로딩 중
[onnxruntime] WebGPU MatMulNBits 최적화: Subgroup Shuffle을 활용한 성능 향상WebGPU MatMulNBits 커널에서 Subgroup Shuffle을 도입하여 A 피연산자의 중복 메모리 읽기를 줄이고 성능을 크게 향상시킨 PR 분석#WebGPU#ONNX Runtime#MatMulNBits#Optimization#WGSL#Subgroup Shuffle2026년 8월 13일댓글 수 로딩 중
[sglang] SGLang의 FLUX.2 추론 최적화: Eager 모드에서의 커널 융합 기법FLUX.2 모델의 Eager 추론 성능을 높이기 위해 AdaLN과 SwiGLU 연산을 Triton 커널로 융합하여 12% 이상의 속도 향상을 달성했습니다.#SGLang#FLUX.2#Triton#Optimization#Inference2026년 8월 13일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 MoE GEMM 최적화: 웨이브+잔여물 비용 모델 도입FlashInfer의 SM120 MoE GEMM 성능을 향상시키는 웨이브+잔여물 비용 모델 도입 및 타일 선택 개선.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#GEMM#FP8#SM1202026년 8월 12일댓글 수 로딩 중
[sglang] [Diffusion] MiniMax-H3 비디오 인입 최적화: 87.5% 메모리 절감과 Zero-Copy의 마법Multi-GPU 환경에서 중복되는 비디오 디코딩을 제거하고, memfd와 mmap을 통해 호스트 레벨에서 데이터를 공유하여 메모리 효율을 극대화한 사례를 분석합니다.#Performance#Python#FFmpeg#Distributed-Computing#Memory-Optimization2026년 8월 12일댓글 수 로딩 중
[vllm] vLLM에 Dots3 NOTE 모델 네이티브 지원 추가: 멀티모달 및 하이브리드 MLA 최적화Dots3 NOTE 모델의 텍스트, 이미지, 오디오, 비디오 처리를 위한 vLLM 네이티브 통합 및 하이브리드 MLA 아키텍처 최적화 분석.#vLLM#LLM#Multimodal#MLA#Optimization2026년 8월 12일댓글 수 로딩 중
[vllm] vLLM의 성능 병목 해결: Host-to-Device 복사 최적화로 비동기 실행 보장하기vLLM에서 발생하는 비효율적인 H2D 복사 문제를 pinned memory 활용 및 스트라이드 최적화로 해결하여 성능을 개선한 사례를 분석합니다.#vLLM#CUDA#Performance Optimization#PyTorch#Deep Learning2026년 8월 12일댓글 수 로딩 중
[flashinfer] [FlashInfer] CUTLASS MoE 커널 최적화: 벡터화와 동적 스레드 할당으로 성능 한계 돌파하기FlashInfer의 CUTLASS MoE 커널을 벡터화하고 스레드 점유율을 최적화하여 최대 8%의 성능 향상을 달성한 기법을 분석합니다.#CUDA#MoE#FlashInfer#CUTLASS#Optimization#LLM2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer의 GDN 커널 런칭 오버헤드 80% 절감하기: 호스트 측 최적화 전략FlashInfer의 GDN 커널 런칭 오버헤드를 캐싱 전략을 통해 434.7us에서 98.2us로 80% 개선한 사례를 분석합니다.#FlashInfer#CUDA#Optimization#Performance#CUTE2026년 8월 11일댓글 수 로딩 중
[sglang] ERNIE-Image의 RoPE와 GELU-mul 융합 및 RoPE cos/sin 호이스팅을 통한 성능 최적화ERNIE-Image 모델에서 RoPE와 GELU-mul 연산을 융합하고 RoPE cos/sin 계산을 최적화하여 H100/H200에서 상당한 성능 향상을 달성했습니다.#ERNIE-Image#PyTorch#Triton#Optimization#RoPE#GELU#Performance2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer: SM120/SM121 아키텍처를 위한 네이티브 MXFP4 W4A4 Fused MoE 지원Blackwell 아키텍처(SM120)에서 MXFP4 데이터 형식을 활용해 Fused MoE 연산 성능을 최적화하고 처리량을 개선했습니다.#FlashInfer#MoE#MXFP4#Blackwell#CUDA#Optimization2026년 8월 10일댓글 수 로딩 중