[flashinfer] Blackwell 시대를 위한 최적화: FlashInfer의 SM120 Block-Sparse Attention 백엔드 도입기NVIDIA Blackwell(SM120) 아키텍처를 위한 Cake 백엔드 기반 Block-Sparse Attention 최적화로 성능을 11% 향상시킨 사례를 분석합니다.#FlashInfer#CUDA#Blackwell#SM120#Attention#Performance-Optimization2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] [FlashInfer] Blackwell 아키텍처를 위한 Warp Level Split-K BF16 GEMM 최적화 분석Blackwell(SM100/103) 환경에서 저지연 Decode GEMM 성능을 극대화하기 위한 Warp Split-K 기법과 Autotuner 개선 사항을 살펴봅니다.#CUDA#GEMM#Blackwell#FlashInfer#Performance-Optimization#vLLM2026년 9월 4일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL을 활용한 저지연 GEMM 커널 도입으로 성능 극대화FlashInfer가 CuTe DSL 기반의 저지연 GEMM 커널을 도입하여 FP4/FP8 연산 성능을 혁신적으로 개선했습니다.#FlashInfer#GEMM#CuTe DSL#FP8#FP4#최적화#성능2026년 9월 3일댓글 수 로딩 중
[flashinfer] FlashInfer의 NVFP4 KV 캐시 성능 최적화: FP4 연산의 병목 현상 해소FlashInfer의 NVFP4 KV 캐시 연산에서 발생하는 심각한 성능 병목 현상을 분석하고, CUDA 하드웨어 기능을 활용하여 최적화하는 방법을 기술합니다.#CUDA#GPU#Performance Optimization#FlashInfer#FP4#NVFP4#KV Cache2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer에 cuTile 기반 Fused MoE 백엔드 도입: 성능과 유지보수성의 균형FlashInfer의 Unified MoE API에 cuTile 백엔드를 추가하여 BF16 및 NVFP4 환경에서 최적화된 MoE 추론을 지원합니다.#FlashInfer#MoE#CUDA#Optimization#LLM2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer SM12x MoE 최적화: 정적 MoE 경로 통합 및 성능 향상FlashInfer의 SM12x 아키텍처에서 정적 MoE 경로를 최적화하고 통합하여 성능을 크게 향상시킨 PR 분석#FlashInfer#MoE#최적화#성능#CUDA#딥러닝2026년 8월 31일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 결정론적 BGMV MoE 최적화NVIDIA Blackwell(SM100) GPU 전용으로 생성된 커널을 통해 BGMV MoE 파이프라인 성능을 최대 4배 이상 향상시켰습니다.#FlashInfer#CUDA#Blackwell#MoE#Performance2026년 8월 30일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처를 위한 Cake All-Gather Matmul 최적화 분석Blackwell GPU(SM100/103) 환경에서 All-Gather Matmul 성능을 극대화하는 Cake 백엔드 도입 및 최적화 기법을 살펴봅니다.#FlashInfer#CUDA#Blackwell#Matmul#All-Gather#GPU Optimization2026년 8월 29일댓글 수 로딩 중
[flashinfer] FlashInfer Blackwell 블록 희소 어텐션 커널 최적화 분석Blackwell 아키텍처를 위한 블록 희소 어텐션 커널의 성능 개선 및 TMA 관리 최적화 사례 분석#FlashInfer#CUDA#Blackwell#Optimization#TMA2026년 8월 28일댓글 수 로딩 중
[vllm] vLLM, FlashInfer BF16 CuTeDSL GEMM 통합으로 저지연 추론 성능 향상vLLM이 FlashInfer BF16 CuTeDSL GEMM을 통합하여 저지연 추론 성능을 개선했습니다.#vLLM#FlashInfer#BF16#GEMM#최적화#딥러닝 추론2026년 8월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 커널 최적화를 통한 LLM 추론 속도 향상: Recurrence-Piece Persistent M128 도입FlashInfer의 최신 PR은 CUDA 커널 최적화를 통해 LLM 추론 성능을 2.7배 향상시킵니다.#AI#LLM#성능 최적화#CUDA#FlashInfer2026년 8월 26일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: flashinfer_nvlink_one_sided 도입vLLM의 MoE 통신 백엔드를 flashinfer_nvlink_one_sided로 기본 설정하여 처리량(Throughput)을 최대 8% 향상시켰습니다.#vLLM#MoE#FlashInfer#NVLink#Performance2026년 8월 26일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 NVFP4 어텐션 최적화: N64 스코어-슬롯 재사용을 통한 성능 향상FlashInfer의 SM120 NVFP4 어텐션 커널을 최적화하여 N64 스코어-슬롯 재사용으로 성능을 크게 향상시켰습니다.#FlashInfer#CUDA#NVIDIA#LLM#최적화#어텐션#NVFP4#SM1202026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer GDN 커널의 SM90/SM120 비-CP 런치 오버헤드 감소 최적화 분석FlashInfer GDN 커널에서 SM90/SM120 GPU의 비-CP 런치 오버헤드를 줄여 성능을 개선한 PR 분석입니다.#FlashInfer#GDN#최적화#성능 개선#CUDA#TVM2026년 8월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 SM100/SM103 최적화: CAKE 기반 블록 희소 어텐션(VSA) 도입CAKE IR을 활용한 SM100/SM103 아키텍처용 고성능 블록 희소 어텐션(VSA) 커널 도입 및 성능 최적화 분석#FlashInfer#CUDA#Attention#Optimization#SM100#CAKE2026년 8월 23일댓글 수 로딩 중
[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MXFP8/MXFP4 기반 고성능 MoE 추론 최적화FlashInfer의 SM100 W4A8 백엔드 추가로 MXFP8/MXFP4 혼합 정밀도 추론 성능 및 통신 효율 대폭 개선#FlashInfer#MoE#Blackwell#MXFP8#CuTeDSL#LLM2026년 8월 20일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 FlashInfer의 Router GEMM 최적화FlashInfer가 NVIDIA Blackwell GPU에서 Router GEMM 연산 성능을 1.1x 이상 향상시킨 최적화 PR 분석#NVIDIA Blackwell#Router GEMM#FlashInfer#GPU 최적화#성능 향상#딥러닝2026년 8월 20일댓글 수 로딩 중
[flashinfer] DeepSeek-V3 라우팅의 혁신: FlashInfer의 Cake 백엔드 가속 분석Blackwell 아키텍처에서 DeepSeek MoE 라우팅 성능을 최대 1.55배 끌어올린 Cake 백엔드의 PTX 최적화 기법을 살펴봅니다.#CUDA#DeepSeek#MoE#FlashInfer#Blackwell#Performance2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer에 NVIDIA Rubin(SM107) 및 Blackwell FP8 GEMM 지원 추가CuTe DSL을 활용한 NVIDIA Rubin 아키텍처 지원 및 Blackwell용 고성능 FP8 GEMM 커널 구현 최적화.#FlashInfer#NVIDIA#Rubin#Blackwell#GEMM#FP8#CuTeDSL2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer의 PrimTS를 활용한 고성능 Block-Sparse Attention 최적화NVIDIA Blackwell 아키텍처를 위한 Q64/KV256 프로파일 및 Paged Block-Sparse Attention 구현으로 성능 극대화#FlashInfer#Attention#CUDA#GPU#LLM2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer, SM100 아키텍처를 위한 BF16 x FP4 GEMM 최적화로 성능 극대화FlashInfer가 SM100 GPU를 위한 BF16 x FP4 GEMM 커널을 도입하여 추론 성능을 크게 향상시켰습니다.#FlashInfer#GEMM#BF16#FP4#NVIDIA GPU#최적화#딥러닝 추론2026년 8월 18일댓글 수 로딩 중
[flashinfer] Gemma-4를 위한 Blackwell 최적화: FlashInfer의 비대칭 VO-Split NVFP4 구현 분석Gemma-4의 비대칭 헤드 구조(QK=512, VO=256)를 Blackwell GPU에서 NVFP4 KV 캐시로 최적화하는 과정을 살펴봅니다.#FlashInfer#Blackwell#NVFP4#Gemma-4#CUDA#LLM Inference2026년 8월 13일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 MoE GEMM 최적화: 웨이브+잔여물 비용 모델 도입FlashInfer의 SM120 MoE GEMM 성능을 향상시키는 웨이브+잔여물 비용 모델 도입 및 타일 선택 개선.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#GEMM#FP8#SM1202026년 8월 12일댓글 수 로딩 중
[flashinfer] [FlashInfer] CUTLASS MoE 커널 최적화: 벡터화와 동적 스레드 할당으로 성능 한계 돌파하기FlashInfer의 CUTLASS MoE 커널을 벡터화하고 스레드 점유율을 최적화하여 최대 8%의 성능 향상을 달성한 기법을 분석합니다.#CUDA#MoE#FlashInfer#CUTLASS#Optimization#LLM2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer의 GDN 커널 런칭 오버헤드 80% 절감하기: 호스트 측 최적화 전략FlashInfer의 GDN 커널 런칭 오버헤드를 캐싱 전략을 통해 434.7us에서 98.2us로 80% 개선한 사례를 분석합니다.#FlashInfer#CUDA#Optimization#Performance#CUTE2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer: SM120/SM121 아키텍처를 위한 네이티브 MXFP4 W4A4 Fused MoE 지원Blackwell 아키텍처(SM120)에서 MXFP4 데이터 형식을 활용해 Fused MoE 연산 성능을 최적화하고 처리량을 개선했습니다.#FlashInfer#MoE#MXFP4#Blackwell#CUDA#Optimization2026년 8월 10일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell GPU를 위한 Gated MoE 커널 최적화로 성능 대폭 향상Blackwell GPU의 Gated Mixture-of-Experts(MoE) 연산 성능을 극대화하는 최적화 기법을 분석합니다.#FlashInfer#MoE#GPU 최적화#Blackwell#NVFP42026년 8월 7일댓글 수 로딩 중
[flashinfer] [FlashInfer] Kimi K3 모델을 위한 초고속 Fused KDA Decode 커널 분석 (SM100 최적화)FlashInfer가 Kimi K3의 핵심 연산들을 하나의 SM100 전용 커널로 통합하여 vLLM 대비 1.13배의 성능 향상을 달성했습니다.#CUDA#FlashInfer#LLM#Optimization#SM100#CuTe2026년 8월 5일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처 최적화: CAKE 기반 TinyGEMM2 커널 도입Blackwell(SM100/103) 아키텍처를 위한 고성능 TinyGEMM2 커널을 도입하여 추론 성능을 최대 1.79배 향상시켰습니다.#FlashInfer#CUDA#Blackwell#GEMM#PerformanceOptimization2026년 8월 5일댓글 수 로딩 중
[flashinfer] Blackwell NVFP4 양자화 최적화: TMA OOB Zero-fill을 이용한 메모리 복사 오버헤드 제거TMA의 하드웨어 기능을 활용해 비정렬 데이터의 패딩 복사 오버헤드를 제거하고 성능을 72% 개선한 FlashInfer의 최적화 사례를 분석합니다.#FlashInfer#NVIDIA Blackwell#NVFP4#TMA#CUDA#Performance Optimization2026년 8월 4일댓글 수 로딩 중
[flashinfer] FlashInfer: B200용 최적화된 Recurrent KDA Prefill 백엔드 도입NVIDIA B200(SM100a) 아키텍처를 위한 고성능 Recurrent KDA Prefill 백엔드 추가 및 성능 최적화 분석#FlashInfer#B200#CUDA#KDA#Performance2026년 8월 3일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 Causal Attention 최적화: O(1) 디코딩과 글로벌 스케줄링의 힘FlashInfer의 FP8 FMHA v2 커널에서 배치 크기가 클 때 발생하는 병목을 O(1) 디코딩과 글로벌 큐 타일 재배치로 해결하여 최대 5.6x 성능 향상을 달성했습니다.#CUDA#LLM#FlashInfer#Performance#Optimization#FP82026년 7월 31일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 모델의 성능을 극적으로 향상시키는 융합 커널과 최적화된 스케줄러 도입FlashInfer가 MoE 모델의 FC1 연산을 융합 커널로 최적화하고, 워프 협력 스케줄러를 도입하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#FP8#MXFP8#CUDA2026년 7월 29일댓글 수 로딩 중
[flashinfer] FlashInfer의 Mixture-of-Experts(MoE) 라우팅 성능 최적화 분석고성능 MoE 워크로드를 위한 TopK 라우팅 최적화: 레지스터 압력 감소 및 병렬화 전략#FlashInfer#CUDA#MoE#Performance#GPU2026년 7월 28일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP8 양자화 AllReduce를 통한 통신 대역폭 최적화FP8 양자화를 통해 AllReduce 통신량을 절반으로 줄여 대규모 모델 학습의 NVLink 병목을 해결합니다.#FlashInfer#AllReduce#FP8#Quantization#NVLink#Triton2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer SM103 FP4 GEMM 최적화: Store256 및 Fused Epilogue 도입SM103 아키텍처에서 256-bit 정렬 스토어와 Fused F32x2 연산을 통해 FP4 GEMM 성능을 최대 16% 향상시킨 기술적 분석.#FlashInfer#CUDA#GEMM#SM103#Optimization#CUTLASS2026년 7월 23일댓글 수 로딩 중
[flashinfer] FlashInfer MoE All-to-All 최적화: TRT-LLM의 성능 비결을 파헤치다FlashInfer의 MoE All-to-All 통신 최적화 PR을 통해 TRT-LLM의 성능 개선 기법을 분석합니다.#FlashInfer#MoE#All-to-All#CUDA#GPU Optimization#TensorRT-LLM#FP8#PDL2026년 7월 22일댓글 수 로딩 중
[flashinfer] FlashInfer의 Fused SwiGLU 및 NVFP4 양자화 최적화 분석SwiGLU 연산과 NVFP4 양자화를 하나로 통합하여 메모리 접근을 줄이고 성능을 최대 1.34배 향상시킨 최적화 기법을 소개합니다.#FlashInfer#CUDA#CuTe#Quantization#Performance2026년 7월 21일댓글 수 로딩 중
[sglang] SM120 Blackwell에서 DeepSeek-V4 모델 서빙 최적화: FlashInfer MXFP4 MoE 도입 및 메모리 절감SM120 GPU에서 DeepSeek-V4 모델 서빙 시 발생하던 문제를 해결하고 성능을 개선한 PR 분석.#sglang#DeepSeek-V4#SM120#Blackwell#FlashInfer#MXFP4#MoE#최적화#성능 개선#메모리 절감2026년 7월 18일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: FlashInfer One-Sided Combine을 활용한 메모리 복사 제거FlashInfer의 one-sided combine 기능을 활용해 MoE 출력 텐서의 불필요한 복사 과정을 제거하고 성능을 개선한 사례를 분석합니다.#vLLM#MoE#FlashInfer#Performance#GPU2026년 7월 16일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP4 GEMM 최적화: 휴리스틱 개선과 Autotuning 효율화FlashInfer의 mm_fp4(cute-dsl) 연산에서 휴리스틱 기반 랭킹과 Top-N Autotuning을 도입하여 컴파일 시간을 획기적으로 단축했습니다.#FlashInfer#GEMM#CUDA#Optimization#LLM#Autotuning2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang에 KDA FlashInfer 백엔드 도입: Blackwell 아키텍처에서의 효율적인 추론FlashInfer KDA 커널을 도입하여 KDA 모델의 추론 성능을 개선하고 MTP(Speculative Decoding)를 위한 target_verify 경로를 구현했습니다.#SGLang#FlashInfer#KDA#Speculative Decoding#LLM Optimization2026년 7월 15일댓글 수 로딩 중
[flashinfer] FlashInfer: NVIDIA Blackwell(SM120)을 위한 고성능 FP8 MoE GEMM 최적화NVIDIA SM120 아키텍처에서 CuTe C++를 활용해 FP8 groupwise MoE GEMM을 구현하여 성능을 극대화했습니다.#FlashInfer#CUDA#GEMM#MoE#Blackwell#FP82026년 7월 14일댓글 수 로딩 중
[sglang] SGLang, FlashInfer의 CuTe DSL 백엔드 도입으로 NVFP4 양자화 성능 극대화SGLang이 FlashInfer의 최신 CuTe DSL 백엔드를 활용하여 NVFP4 양자화 성능을 크게 향상시킵니다.#SGLang#FlashInfer#NVFP4#양자화#성능 최적화#CuTe DSL#LLM2026년 7월 13일댓글 수 로딩 중
[vllm] vLLM의 FlashInfer MNNVL AllReduce RMSNorm 양자화 융합 최적화vLLM에서 FlashInfer의 MNNVL 백엔드를 활용해 AllReduce와 RMSNorm 양자화 융합을 활성화하여 성능을 개선하는 방법.#vLLM#FlashInfer#MNNVL#AllReduce#Optimization2026년 7월 13일댓글 수 로딩 중
[flashinfer] FlashInfer MoE 최적화: PDL 스케줄링 개선 및 GEMM2 균형 잡힌 스토어 구현FlashInfer의 MoE 커널에서 PDL 시작 지연을 줄이고 GEMM2의 부분 타일 스토어를 워프 간 인터리빙하여 성능을 향상시킨 최적화 분석.#FlashInfer#MoE#CUDA#CuTe#GEMM#Performance2026년 7월 11일댓글 수 로딩 중
[flashinfer] FlashInfer 분산 오토튜닝 동기화: NCCL 데드락 해결을 위한 전략적 접근분산 환경에서 오토튜닝 시 발생하는 GPU 타이밍 오차로 인한 NCCL 데드락 문제를 ProcessGroup 동기화로 해결합니다.#FlashInfer#Distributed Computing#NCCL#AutoTuning#LLM2026년 7월 10일댓글 수 로딩 중
[flashinfer] FlashInfer, 초저병렬성 환경에서의 CP 델타 규칙 사전 계산 최적화FlashInfer가 초저병렬성 환경에서 CP 델타 규칙 사전 계산 성능을 개선했습니다.#FlashInfer#LLM#최적화#GPU#CUDA2026년 7월 8일댓글 수 로딩 중
[flashinfer] FlashInfer의 BF16 GEMM 성능 극대화: CUDA Graph와 Cold L2 Cache 도입FlashInfer의 SM100 타겟 BF16 GEMM 연산에 CUDA Graph와 Cold L2 Cache를 적용하여 오버헤드를 줄이고 성능 안정성을 확보한 사례를 분석합니다.#FlashInfer#CUDA#GEMM#PerformanceOptimization#GPU2026년 7월 8일댓글 수 로딩 중
[flashinfer] FlashInfer의 새로운 TGV GEMM 백엔드: CuTeDSL을 활용한 Blackwell 최적화FlashInfer에 Blackwell 아키텍처를 위한 고성능 TGV GEMM 백엔드가 추가되었습니다. CuTeDSL 기반의 2-CTA 모드로 성능을 극대화합니다.#FlashInfer#GEMM#CUDA#Blackwell#CuTeDSL#GPU Optimization2026년 7월 3일댓글 수 로딩 중
[flashinfer] FlashInfer의 TRTLLM-Gen MoE 라우팅 최적화: 레지스터 압박 해소와 성능 극대화MoE 라우팅 커널의 스레드 블록 크기를 동적으로 최적화하여 레지스터 압박을 줄이고 고성능을 달성한 사례 분석.#FlashInfer#MoE#CUDA#GPU Optimization#TRTLLM2026년 6월 29일댓글 수 로딩 중
[flashinfer] FlashInfer, SM120 GPU를 위한 희소 MLA 커널 추가로 LLM 추론 속도 향상FlashInfer가 SM120 GPU를 위한 희소 MLA 커널을 도입하여 LLM 추론 성능을 대폭 개선했습니다.#FlashInfer#LLM#GPU 최적화#CUDA 커널#머신러닝2026년 6월 15일댓글 수 로딩 중
[flashinfer] FlashInfer Unified MoE API: NVFP4 백엔드 통합 및 자동 튜닝 최적화CuteDSL과 TRTLLM FP4 백엔드를 통합하고, 런타임 자동 튜닝을 통해 최적의 성능을 선택하는 Unified MoE API 설계 및 구현.#FlashInfer#MoE#NVFP4#Autotuning#LLM2026년 6월 10일댓글 수 로딩 중
[flashinfer] FlashInfer의 MoE Routing 성능 최적화: Batcher's Odd-Even Merge Sort 도입FlashInfer의 MoE Top-K 연산에서 64비트 리덕션 최적화 및 비-2의 거듭제곱 정렬을 Batcher's 네트워크로 개선하여 성능을 극대화했습니다.#FlashInfer#CUDA#MoE#Optimization#GPU#Sorting2026년 6월 4일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 KV-Cache Prefill 성능 최적화: Repacking 기법을 통한 오버헤드 제거FP8 KV-cache의 dequantization 오버헤드를 BF16 staging buffer로 제거하여 Prefill 성능을 최대 1.3배 향상시켰습니다.#FlashInfer#CUDA#FP8#LLM#Optimization2026년 6월 2일댓글 수 로딩 중
[논문리뷰] LVSA: Training-Free Sparse Attention for Long Video Diffusion본 논문은 video diffusion transformers의 긴 영상 생성 과정에서 발생하는 dense self-attention의 연산 효율성 저하와 품질 저하 문제를 해결합니다.#Review#Video Diffusion Transformers#Sparse Attention#Long Video Generation#Training-Free#FlashInfer#Attention Optimization2026년 6월 1일댓글 수 로딩 중
[flashinfer] FlashInfer MLA 커널 최적화: num_heads < 128 환경에서의 성능 극대화Blackwell GPU에서 MLA 디코드 커널의 num_heads < 128 성능을 개선하기 위해 seqlen_q를 헤드 차원으로 폴딩하는 최적화 기법을 소개합니다.#FlashInfer#GPU#MLA#Optimization#Blackwell#CUDA2026년 5월 29일댓글 수 로딩 중
[flashinfer] FlashInfer의 DeepSeek V4 Sparse MLA 최적화 분석DeepSeek V4의 Sparse MLA를 지원하기 위한 커널 최적화 및 가변 Top-K 처리 로직 개선 사항을 분석합니다.#FlashInfer#DeepSeek#CUDA#LLM#Optimization2026년 5월 21일댓글 수 로딩 중
[flashinfer] FlashInfer Mamba SSU 커널 최적화: Async State Prefetching과 Vectorized Load를 통한 성능 혁신FlashInfer의 Mamba SSU 커널이 Async State Prefetching, Vectorized Load 등으로 극적인 성능 향상을 이루었습니다.#FlashInfer#Mamba#SSU#Kernel Optimization#Triton#CUDA#Performance2026년 5월 13일댓글 수 로딩 중
[flashinfer] FlashInfer, 동적 토큰 페이지 커널 도입으로 TRTLLM-GEN GQA 성능 최적화FlashInfer가 TRTLLM-GEN GQA 커널에 동적 토큰 페이지 기능을 도입하여 LLM 추론 성능을 향상시켰습니다.#FlashInfer#LLM#최적화#GQA#TRTLLM-GEN#성능2026년 5월 11일댓글 수 로딩 중
[sglang] SGLang의 FP4 GEMM 성능 최적화: CuTe DSL 백엔드 도입SGLang에 FlashInfer의 CuTe DSL 기반 FP4 GEMM 백엔드를 추가하여 SM100 아키텍처에서의 연산 성능을 최적화했습니다.#SGLang#FP4#GEMM#CUDA#CuTe#FlashInfer2026년 5월 9일댓글 수 로딩 중
[flashinfer] FlashInfer의 Per-token NVFP4 Quantization 커널 최적화 분석FlashInfer의 NVFP4 양자화 커널 성능 개선: 블록 사이즈 최적화 및 Fast Math 제어 옵션 도입#FlashInfer#CUDA#Quantization#LLM#Performance2026년 5월 8일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 및 FP8 GEMM 성능 향상을 위한 커널 업데이트FlashInfer의 MoE 및 FP8 GEMM 커널 업데이트를 통해 성능을 최적화하고 호환성을 개선합니다.#FlashInfer#GEMM#MoE#FP8#CUDA#최적화2026년 5월 8일댓글 수 로딩 중
[flashinfer] FlashInfer, FP8 지원으로 장문 컨텍스트 추론 성능을 극적으로 향상시키다FlashInfer의 concat_mla_k 함수에 FP8 지원을 추가하여 장문 컨텍스트 추론 성능을 크게 개선했습니다.#FlashInfer#FP8#LLM#최적화#성능 향상#딥러닝2026년 5월 7일댓글 수 로딩 중
[flashinfer] FlashInfer BF16 XQA MLA 커널의 10가지 버그 수정 및 최적화 분석FlashInfer의 BF16 XQA MLA 커널에서 발생한 10가지 치명적인 버그를 수정하고 성능을 개선한 PR을 분석합니다.#FlashInfer#CUDA#Kernel Optimization#BF16#XQA#MLA2026년 5월 7일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 그래프 호환성을 높이고 성능을 최적화하다: TRT-LLM FMHA v2 통합 및 불필요한 H2D 제거FlashInfer가 TRT-LLM FMHA v2를 통합하고 CUDA 그래프 호환성을 개선하여 성능을 최적화한 PR을 분석합니다.#FlashInfer#TRT-LLM#CUDA#최적화#성능#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer: Wide Vector 최적화와 1900줄의 코드 삭제로 달성한 성능 개선gdn_wide_vec_kernel 도입과 불필요한 레거시 커널 제거를 통해 B200에서 최대 82%의 DRAM 대역폭 효율을 달성한 사례를 분석합니다.#CUDA#PyTorch#FlashInfer#Performance-Optimization#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer의 DiT 최적화: SageAttention과 Int8/FP8 혼합 정밀도 커널 도입 분석FlashInfer에 DiT 모델 최적화를 위한 SageAttention 스케일링 팩터 지원 및 Int8/FP8 혼합 정밀도 커널이 추가되었습니다.#FlashInfer#CUDA#DiT#SageAttention#Quantization#DeepLearning2026년 5월 1일댓글 수 로딩 중
[sglang] FlashInfer TRTLLM-Gen MoE 커널 최적화: NemotronH 모델 지원 및 성능 향상FlashInfer TRTLLM-Gen MoE 커널에 NemotronH 모델 지원을 추가하고 성능을 최적화한 PR 분석.#FlashInfer#TRTLLM#MoE#NemotronH#FP4#FP8#Kernel Optimization#Deep Learning#Performance2026년 4월 29일댓글 수 로딩 중
[flashinfer] FlashInfer 오토튜너 최적화: 하이브리드 토큰 버킷 도입기존 2의 거듭제곱 방식의 토큰 버킷을 하이브리드 방식으로 개선하여 MoE 및 GEMM 커널의 튜닝 정확도와 성능을 향상시켰습니다.#FlashInfer#LLM#Autotuning#Optimization#MoE2026년 4월 24일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL 기반 FMHA 커널 통합으로 사전 생성(Prefill) 성능 극대화FlashInfer가 CuTe DSL FMHA 커널을 통합하여 사전 생성(Prefill) 성능을 최적화했습니다.#FlashInfer#CuTe DSL#FMHA#Prefill#최적화#성능 개선#딥러닝#LLM2026년 4월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 고성능 분산 연산: All-Gather Matmul 최적화 분석FlashInfer에 추가된 All-gather Matmul 연산은 Push-Wait 알고리즘을 통해 분산 환경에서 GEMM 성능을 극대화합니다.#FlashInfer#Distributed Computing#CUDA#GEMM#Performance Optimization2026년 4월 24일댓글 수 로딩 중
[SGLang] FlashInfer: 래그드 텐서 어텐션 엔진SGLang의 FlashInfer 백엔드를 분석한다. 가변 길이 시퀀스를 위한 래그드 텐서 처리, FlashAttention 대비 장점, Paged KV Cache 통합을 코드와 함께 살펴본다.#sglang#FlashInfer#Ragged Tensor#Variable Length2026년 4월 11일댓글 수 로딩 중
[sglang] SGLang DeepSeekV3 Router GEMM 최적화: FlashInfer 커널 도입 및 벤치마킹DeepSeekV3 라우터 GEMM 성능 최적화를 위해 FlashInfer 커널을 도입하고 벤치마킹합니다.#SGLang#DeepSeekV3#FlashInfer#GEMM#최적화#벤치마킹#Blackwell#GPU2026년 4월 4일댓글 수 로딩 중
[sglang] SGLang: MiniMax-M2.5 MoE 모델을 위한 FP8 FlashInfer TRT-LLM 라우팅 최적화SGLang에서 MiniMax-M2.5 MoE 모델의 FP8 추론 성능을 FlashInfer TRT-LLM으로 최적화한 PR 분석.#SGLang#FlashInfer#TRT-LLM#MoE#FP8#최적화#성능#MiniMax-M2.52026년 4월 2일댓글 수 로딩 중
[sglang] FlashInfer v0.6.7 MXFP8 Gemm 통합: CUTLASS와 TensorRT-LLM 백엔드 분리SGLang에 FlashInfer의 TensorRT-LLM MXFP8 Gemm 커널을 통합하고, CUTLASS 백엔드와의 weight 전처리 및 호출 경로를 명확히 분리한 코드 분석.#SGLang#FlashInfer#MXFP8#CUTLASS#TensorRT-LLM#Quantization#Blackwell2026년 4월 1일댓글 수 로딩 중
[sglang] CI 테스트 최적화: MXFP8 Gemm에 오프라인 양자화 체크포인트 적용SGLang CI에서 MXFP8 Gemm 테스트를 온라인 양자화 대신 사전 양자화된 체크포인트로 전환하여 테스트 안정성과 속도를 개선한 분석.#SGLang#CI#FlashInfer#MXFP8#Quantization#Testing2026년 3월 30일댓글 수 로딩 중