[flashinfer] Blackwell 아키텍처를 위한 MXFP8/MXFP4 기반 고성능 MoE 추론 최적화FlashInfer의 SM100 W4A8 백엔드 추가로 MXFP8/MXFP4 혼합 정밀도 추론 성능 및 통신 효율 대폭 개선#FlashInfer#MoE#Blackwell#MXFP8#CuTeDSL#LLM2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer에 NVIDIA Rubin(SM107) 및 Blackwell FP8 GEMM 지원 추가CuTe DSL을 활용한 NVIDIA Rubin 아키텍처 지원 및 Blackwell용 고성능 FP8 GEMM 커널 구현 최적화.#FlashInfer#NVIDIA#Rubin#Blackwell#GEMM#FP8#CuTeDSL2026년 8월 20일댓글 수 로딩 중
[cutlass] NVIDIA Hopper에서 FP8 GEMM + GELU 퓨전 최적화: CuTe DSL 활용Hopper GPU에서 FP8 GEMM과 GELU를 퓨전하여 성능을 최적화하고 유연성을 확보하는 기술 분석.#NVIDIA#Hopper#CuTeDSL#GEMM#FP8#GELU#Optimization#CUDA#Deep Learning2026년 7월 14일댓글 수 로딩 중
[flashinfer] FlashInfer의 새로운 TGV GEMM 백엔드: CuTeDSL을 활용한 Blackwell 최적화FlashInfer에 Blackwell 아키텍처를 위한 고성능 TGV GEMM 백엔드가 추가되었습니다. CuTeDSL 기반의 2-CTA 모드로 성능을 극대화합니다.#FlashInfer#GEMM#CUDA#Blackwell#CuTeDSL#GPU Optimization2026년 7월 3일댓글 수 로딩 중