[flashinfer] NVIDIA Blackwell(SM120)을 위한 초고속 커널 최적화: MiniMax-H3 Fused FC1 + SwiGLU 분석RTX 5090 및 Blackwell 아키텍처에서 FP8/NVFP4 양자화를 활용하여 MiniMax-H3 모델의 FC1+SwiGLU 연산을 최대 2.7배 가속화하는 기법을 살펴봅니다.#CUDA#NVIDIA Blackwell#FlashInfer#Deep Learning Optimization#Quantization2026년 9월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MoE All-Reduce Fusion 최적화: FlashInfer의 'Cake' 백엔드 분석Blackwell(SM100/103) 환경에서 MoE All-Reduce와 RMSNorm을 융합하여 1.12배 성능 향상을 달성한 FlashInfer의 새로운 최적화 기법을 살펴봅니다.#NVIDIA Blackwell#MoE#All-Reduce#CUDA#FlashInfer#Performance Optimization2026년 9월 16일댓글 수 로딩 중
[sglang] SGLang, NVIDIA Blackwell GPU를 위한 Wan2.2 모델의 ML P 연산 최적화NVIDIA Blackwell GPU에서 Wan2.2 모델의 메모리 바운드 연산을 융합하여 성능을 개선합니다.#SGLang#NVIDIA Blackwell#GPU 최적화#MLP#Kernel Fusion#NVFP42026년 8월 30일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 FlashInfer의 Router GEMM 최적화FlashInfer가 NVIDIA Blackwell GPU에서 Router GEMM 연산 성능을 1.1x 이상 향상시킨 최적화 PR 분석#NVIDIA Blackwell#Router GEMM#FlashInfer#GPU 최적화#성능 향상#딥러닝2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] Blackwell NVFP4 양자화 최적화: TMA OOB Zero-fill을 이용한 메모리 복사 오버헤드 제거TMA의 하드웨어 기능을 활용해 비정렬 데이터의 패딩 복사 오버헤드를 제거하고 성능을 72% 개선한 FlashInfer의 최적화 사례를 분석합니다.#FlashInfer#NVIDIA Blackwell#NVFP4#TMA#CUDA#Performance Optimization2026년 8월 4일댓글 수 로딩 중