[sglang] SGLang, NVIDIA Blackwell GPU를 위한 Wan2.2 모델의 ML P 연산 최적화NVIDIA Blackwell GPU에서 Wan2.2 모델의 메모리 바운드 연산을 융합하여 성능을 개선합니다.#SGLang#NVIDIA Blackwell#GPU 최적화#MLP#Kernel Fusion#NVFP42026년 8월 30일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 FlashInfer의 Router GEMM 최적화FlashInfer가 NVIDIA Blackwell GPU에서 Router GEMM 연산 성능을 1.1x 이상 향상시킨 최적화 PR 분석#NVIDIA Blackwell#Router GEMM#FlashInfer#GPU 최적화#성능 향상#딥러닝2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell GPU를 위한 Gated MoE 커널 최적화로 성능 대폭 향상Blackwell GPU의 Gated Mixture-of-Experts(MoE) 연산 성능을 극대화하는 최적화 기법을 분석합니다.#FlashInfer#MoE#GPU 최적화#Blackwell#NVFP42026년 8월 7일댓글 수 로딩 중
[flashinfer] FlashInfer, SM120 GPU를 위한 희소 MLA 커널 추가로 LLM 추론 속도 향상FlashInfer가 SM120 GPU를 위한 희소 MLA 커널을 도입하여 LLM 추론 성능을 대폭 개선했습니다.#FlashInfer#LLM#GPU 최적화#CUDA 커널#머신러닝2026년 6월 15일댓글 수 로딩 중
[sglang] ROCm 아키텍처별 최적화: 런타임 디스패치로 성능 극대화ROCm 커널의 멀티 아키텍처 지원 강화 및 런타임 최적화를 통해 성능을 향상시킨 PR 분석#ROCm#GPU 최적화#커널 프로그래밍#FP8#TopK#성능 향상2026년 6월 11일댓글 수 로딩 중
[vllm] vLLM W8W8 그룹 양자화 성능 최적화: 2D-Grid를 통한 Divmod 제거vLLM의 W8W8 그룹 양자화 커널에서 divmod 연산을 2D-grid로 대체하여 성능을 개선합니다.#vLLM#CUDA#GPU 최적화#양자화#성능#divmod#2D-grid2026년 5월 12일댓글 수 로딩 중