[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[triton] Triton Blackwell 커널의 MXFP8 활성화 스케일 최적화: Zero Padding 전략Blackwell 아키텍처에서 MXFP8 활성화 스케일 저장 시 발생하는 성능 저하를 Producer 측의 Zero Padding으로 해결한 사례 분석.#Triton#Blackwell#MXFP8#KernelOptimization#GPU2026년 7월 24일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 최적화: 불필요한 커널 실행 제거를 통한 성능 향상DeepSeek-V4의 SparseAttnCompressC128 커널 실행 전 경계 조건을 미리 확인하여 불필요한 연산을 건너뜀으로써 성능을 약 2배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#KernelOptimization#Performance2026년 7월 22일댓글 수 로딩 중
[vllm] vLLM의 성능 극대화: Helion 커널을 활용한 fused_qk_norm_rope 최적화vLLM에 Helion 커널을 도입하여 fused_qk_norm_rope 연산 성능을 H100 기준 최대 1.38배 향상시킨 사례 분석.#vLLM#Helion#KernelOptimization#CUDA#LLM2026년 6월 29일댓글 수 로딩 중
[sglang] SGLang의 add_constant 커널 최적화: 아키텍처 인지 벡터화(Vectorization) 도입대규모 텐서 연산 시 벡터화된 커널을 사용하여 add_constant 성능을 최대 35% 향상시키는 최적화 기법을 분석합니다.#SGLang#CUDA#KernelOptimization#Vectorization#H2002026년 5월 30일댓글 수 로딩 중
[vllm] vLLM DeepSeek v4 Fused Indexer Q 양자화 커널 최적화: CuteDSL을 활용한 성능 향상vLLM의 DeepSeek v4 Indexer Q 커널을 CuteDSL로 재작성하여 256비트 로드를 활용, 성능을 대폭 개선합니다.#vLLM#DeepSeekV4#CUDA#CuteDSL#KernelOptimization#GPUPerformance#MXFP4#Quantization2026년 5월 9일댓글 수 로딩 중
[sglang] SGLang의 성능 향상을 위한 기본 Quantization 커널 최적화: v2 도입SGLang에서 고부하 워크로드 처리를 위해 더 빠른 per-token group quantization v2 커널을 기본값으로 설정한 변경사항을 분석합니다.#SGLang#LLM#Quantization#CUDA#KernelOptimization2026년 4월 11일댓글 수 로딩 중