[flashinfer] [FlashInfer] Kimi K3 모델을 위한 초고속 Fused KDA Decode 커널 분석 (SM100 최적화)FlashInfer가 Kimi K3의 핵심 연산들을 하나의 SM100 전용 커널로 통합하여 vLLM 대비 1.13배의 성능 향상을 달성했습니다.#CUDA#FlashInfer#LLM#Optimization#SM100#CuTe2026년 8월 5일댓글 수 로딩 중
[flashinfer] FlashInfer의 Fused SwiGLU 및 NVFP4 양자화 최적화 분석SwiGLU 연산과 NVFP4 양자화를 하나로 통합하여 메모리 접근을 줄이고 성능을 최대 1.34배 향상시킨 최적화 기법을 소개합니다.#FlashInfer#CUDA#CuTe#Quantization#Performance2026년 7월 21일댓글 수 로딩 중
[flashinfer] FlashInfer MoE 최적화: PDL 스케줄링 개선 및 GEMM2 균형 잡힌 스토어 구현FlashInfer의 MoE 커널에서 PDL 시작 지연을 줄이고 GEMM2의 부분 타일 스토어를 워프 간 인터리빙하여 성능을 향상시킨 최적화 분석.#FlashInfer#MoE#CUDA#CuTe#GEMM#Performance2026년 7월 11일댓글 수 로딩 중
[sglang] SGLang의 FP4 GEMM 성능 최적화: CuTe DSL 백엔드 도입SGLang에 FlashInfer의 CuTe DSL 기반 FP4 GEMM 백엔드를 추가하여 SM100 아키텍처에서의 연산 성능을 최적화했습니다.#SGLang#FP4#GEMM#CUDA#CuTe#FlashInfer2026년 5월 9일댓글 수 로딩 중