[flashinfer] Blackwell 시대를 위한 최적화: FlashInfer의 SM120 Block-Sparse Attention 백엔드 도입기NVIDIA Blackwell(SM120) 아키텍처를 위한 Cake 백엔드 기반 Block-Sparse Attention 최적화로 성능을 11% 향상시킨 사례를 분석합니다.#FlashInfer#CUDA#Blackwell#SM120#Attention#Performance-Optimization2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] [FlashInfer] Blackwell 아키텍처를 위한 Warp Level Split-K BF16 GEMM 최적화 분석Blackwell(SM100/103) 환경에서 저지연 Decode GEMM 성능을 극대화하기 위한 Warp Split-K 기법과 Autotuner 개선 사항을 살펴봅니다.#CUDA#GEMM#Blackwell#FlashInfer#Performance-Optimization#vLLM2026년 9월 4일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 결정론적 BGMV MoE 최적화NVIDIA Blackwell(SM100) GPU 전용으로 생성된 커널을 통해 BGMV MoE 파이프라인 성능을 최대 4배 이상 향상시켰습니다.#FlashInfer#CUDA#Blackwell#MoE#Performance2026년 8월 30일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처를 위한 Cake All-Gather Matmul 최적화 분석Blackwell GPU(SM100/103) 환경에서 All-Gather Matmul 성능을 극대화하는 Cake 백엔드 도입 및 최적화 기법을 살펴봅니다.#FlashInfer#CUDA#Blackwell#Matmul#All-Gather#GPU Optimization2026년 8월 29일댓글 수 로딩 중
[flashinfer] FlashInfer Blackwell 블록 희소 어텐션 커널 최적화 분석Blackwell 아키텍처를 위한 블록 희소 어텐션 커널의 성능 개선 및 TMA 관리 최적화 사례 분석#FlashInfer#CUDA#Blackwell#Optimization#TMA2026년 8월 28일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MXFP8/MXFP4 기반 고성능 MoE 추론 최적화FlashInfer의 SM100 W4A8 백엔드 추가로 MXFP8/MXFP4 혼합 정밀도 추론 성능 및 통신 효율 대폭 개선#FlashInfer#MoE#Blackwell#MXFP8#CuTeDSL#LLM2026년 8월 20일댓글 수 로딩 중
[flashinfer] DeepSeek-V3 라우팅의 혁신: FlashInfer의 Cake 백엔드 가속 분석Blackwell 아키텍처에서 DeepSeek MoE 라우팅 성능을 최대 1.55배 끌어올린 Cake 백엔드의 PTX 최적화 기법을 살펴봅니다.#CUDA#DeepSeek#MoE#FlashInfer#Blackwell#Performance2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer에 NVIDIA Rubin(SM107) 및 Blackwell FP8 GEMM 지원 추가CuTe DSL을 활용한 NVIDIA Rubin 아키텍처 지원 및 Blackwell용 고성능 FP8 GEMM 커널 구현 최적화.#FlashInfer#NVIDIA#Rubin#Blackwell#GEMM#FP8#CuTeDSL2026년 8월 20일댓글 수 로딩 중
[flashinfer] Gemma-4를 위한 Blackwell 최적화: FlashInfer의 비대칭 VO-Split NVFP4 구현 분석Gemma-4의 비대칭 헤드 구조(QK=512, VO=256)를 Blackwell GPU에서 NVFP4 KV 캐시로 최적화하는 과정을 살펴봅니다.#FlashInfer#Blackwell#NVFP4#Gemma-4#CUDA#LLM Inference2026년 8월 13일댓글 수 로딩 중
[flashinfer] FlashInfer: SM120/SM121 아키텍처를 위한 네이티브 MXFP4 W4A4 Fused MoE 지원Blackwell 아키텍처(SM120)에서 MXFP4 데이터 형식을 활용해 Fused MoE 연산 성능을 최적화하고 처리량을 개선했습니다.#FlashInfer#MoE#MXFP4#Blackwell#CUDA#Optimization2026년 8월 10일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell GPU를 위한 Gated MoE 커널 최적화로 성능 대폭 향상Blackwell GPU의 Gated Mixture-of-Experts(MoE) 연산 성능을 극대화하는 최적화 기법을 분석합니다.#FlashInfer#MoE#GPU 최적화#Blackwell#NVFP42026년 8월 7일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처 최적화: CAKE 기반 TinyGEMM2 커널 도입Blackwell(SM100/103) 아키텍처를 위한 고성능 TinyGEMM2 커널을 도입하여 추론 성능을 최대 1.79배 향상시켰습니다.#FlashInfer#CUDA#Blackwell#GEMM#PerformanceOptimization2026년 8월 5일댓글 수 로딩 중
[vllm] [vLLM] Hopper와 Blackwell을 위한 Router GEMM 최적화: DeepSeek-V4와 GLM5.2 성능 극대화하기vLLM에서 MoE 모델의 병목인 Router GEMM을 GPU 아키텍처별로 정밀 튜닝하여 최대 5.8%의 성능 향상을 이끌어낸 과정을 살펴봅니다.#vLLM#CUDA#MoE#DeepSeek-V4#Performance-Tuning#Hopper#Blackwell2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Characterizing Warp Divergence from Pascal to Blackwell본 논문은 ITS 도입 이후 NVIDIA GPU의 warp divergence 처리 방식이 고정되어 있다는 업계의 통념을 검증하는 것을 목표로 합니다.#Review#GPU#Warp Divergence#Independent Thread Scheduling#Reconvergence#SASS#Microarchitecture#Blackwell2026년 7월 27일댓글 수 로딩 중
[sglang] [DeepSeek-V4 최적화] SM120(Blackwell)에서 Fused MHC 커널 활성화로 성능 8.9% 향상시키기SM120 아키텍처에서 잘못된 플래그 게이팅을 수정하여 DeepSeek-V4의 Fused MHC 커널을 활성화하고 디코드 성능을 대폭 개선했습니다.#DeepSeek-V4#SM120#Blackwell#Kernel Fusion#SGLang#Performance2026년 7월 26일댓글 수 로딩 중
[triton] Triton Blackwell 커널의 MXFP8 활성화 스케일 최적화: Zero Padding 전략Blackwell 아키텍처에서 MXFP8 활성화 스케일 저장 시 발생하는 성능 저하를 Producer 측의 Zero Padding으로 해결한 사례 분석.#Triton#Blackwell#MXFP8#KernelOptimization#GPU2026년 7월 24일댓글 수 로딩 중
[vllm] vLLM, Blackwell 아키텍처를 위한 디코드 성능 최적화: GLM-5.2 및 DeepSeek-V3.2 지원 강화vLLM이 Blackwell GPU에서 GLM-5.2 및 DeepSeek-V3.2 모델의 디코드 성능을 대폭 향상시키는 최적화를 소개합니다.#vLLM#Blackwell#GLM-5.2#DeepSeek-V3.2#성능 최적화#GPU 컴퓨팅#LLM2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Blackwell (SM120+)에서 NVFP4 QMoE를 위한 네이티브 FP4xFP4 Prefill 최적화ONNX Runtime이 Blackwell GPU에서 NVFP4 QMoE의 FP4xFP4 prefill 경로를 최적화하고, SM120 빌드 오류를 해결한 PR 분석.#ONNXRuntime#CUDA#FP4#Quantization#Blackwell#SM120#CUTLASS#Optimization#MoE2026년 7월 24일댓글 수 로딩 중
[sglang] SM120 Blackwell에서 DeepSeek-V4 모델 서빙 최적화: FlashInfer MXFP4 MoE 도입 및 메모리 절감SM120 GPU에서 DeepSeek-V4 모델 서빙 시 발생하던 문제를 해결하고 성능을 개선한 PR 분석.#sglang#DeepSeek-V4#SM120#Blackwell#FlashInfer#MXFP4#MoE#최적화#성능 개선#메모리 절감2026년 7월 18일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS SM100 GEMM 커널 최적화 및 분산 환경 개선 분석NVIDIA Blackwell(SM100) 아키텍처를 위한 GEMM 커널 튜닝과 분산 환경에서의 메모리 관리 최적화 사례를 살펴봅니다.#NVIDIA#CUTLASS#CUDA#GEMM#Blackwell#HPC2026년 7월 16일댓글 수 로딩 중
[flashinfer] FlashInfer: NVIDIA Blackwell(SM120)을 위한 고성능 FP8 MoE GEMM 최적화NVIDIA SM120 아키텍처에서 CuTe C++를 활용해 FP8 groupwise MoE GEMM을 구현하여 성능을 극대화했습니다.#FlashInfer#CUDA#GEMM#MoE#Blackwell#FP82026년 7월 14일댓글 수 로딩 중
[triton] Triton: Blackwell 아키텍처를 위한 TMEM Load-Reduce 연산 퓨전 최적화Blackwell sm103+ GPU에서 TMEM Load와 Row Reduction을 단일 PTX 명령어로 퓨전하여 성능을 개선했습니다.#Triton#Blackwell#GPU#Optimization#Compiler2026년 7월 7일댓글 수 로딩 중
[flashinfer] FlashInfer의 새로운 TGV GEMM 백엔드: CuTeDSL을 활용한 Blackwell 최적화FlashInfer에 Blackwell 아키텍처를 위한 고성능 TGV GEMM 백엔드가 추가되었습니다. CuTeDSL 기반의 2-CTA 모드로 성능을 극대화합니다.#FlashInfer#GEMM#CUDA#Blackwell#CuTeDSL#GPU Optimization2026년 7월 3일댓글 수 로딩 중
[flashinfer] FlashInfer MLA 커널 최적화: num_heads < 128 환경에서의 성능 극대화Blackwell GPU에서 MLA 디코드 커널의 num_heads < 128 성능을 개선하기 위해 seqlen_q를 헤드 차원으로 폴딩하는 최적화 기법을 소개합니다.#FlashInfer#GPU#MLA#Optimization#Blackwell#CUDA2026년 5월 29일댓글 수 로딩 중
[vllm] vLLM 기술 딥다이브: CUTLASS를 활용한 NVFP4 Linear 커널의 Batch Invariance 최적화vLLM에서 NVFP4 양자화 연산의 배치 크기 독립적 결과(Batch Invariance)를 보장하고 성능을 극대화한 CUTLASS 커널 개선 사례를 분석합니다.#vLLM#CUTLASS#NVFP4#CUDA#Optimization#Blackwell2026년 5월 23일댓글 수 로딩 중
[vllm] Blackwell을 위한 새로운 MLA 백엔드: TOKENSPEED_MLA 분석 (DeepSeek R1 최적화)Blackwell(SM100) 아키텍처에서 DeepSeek R1의 MLA 성능을 극대화하는 TOKENSPEED_MLA 백엔드 도입 및 분석.#vLLM#DeepSeek-R1#MLA#Blackwell#CUDA#Performance-Optimization2026년 5월 14일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell SM120을 위한 MoE Short-Decode 최적화 분석FlashInfer의 SM120 MoE 커널 업데이트를 통해 단일 토큰 디코딩 성능을 극대화하는 마이크로 커널 최적화 기법을 살펴봅니다.#CUDA#MoE#Blackwell#Performance#Triton2026년 5월 7일댓글 수 로딩 중
[sglang] SGLang DeepSeekV3 Router GEMM 최적화: FlashInfer 커널 도입 및 벤치마킹DeepSeekV3 라우터 GEMM 성능 최적화를 위해 FlashInfer 커널을 도입하고 벤치마킹합니다.#SGLang#DeepSeekV3#FlashInfer#GEMM#최적화#벤치마킹#Blackwell#GPU2026년 4월 4일댓글 수 로딩 중
[sglang] Blackwell GPU에서 TRT-LLM 커널을 DSA 기본값으로 설정Blackwell(SM>=10) GPU에서 dp_size 조건을 제거하고 TRT-LLM 커널을 항상 기본 사용하도록 변경#SGLang#TRT-LLM#Blackwell#DeepSeek2026년 4월 2일댓글 수 로딩 중
[sglang] FlashInfer v0.6.7 MXFP8 Gemm 통합: CUTLASS와 TensorRT-LLM 백엔드 분리SGLang에 FlashInfer의 TensorRT-LLM MXFP8 Gemm 커널을 통합하고, CUTLASS 백엔드와의 weight 전처리 및 호출 경로를 명확히 분리한 코드 분석.#SGLang#FlashInfer#MXFP8#CUTLASS#TensorRT-LLM#Quantization#Blackwell2026년 4월 1일댓글 수 로딩 중
[sglang] GB300 Nightly 벤치마크 테스트 스위트 추가SGLang CI에 NVIDIA GB300(Blackwell) 전용 nightly 벤치마크 테스트를 추가하고, NeMo Skills 기반 VLM 평가 인프라를 구축한 분석.#SGLang#CI#Benchmark#GB300#Blackwell#NeMo Skills#VLM2026년 3월 29일댓글 수 로딩 중
[triton] Consumer Blackwell(sm_120)에서 PTX Codegen Segfault 수정RTX 5070 Ti 등 consumer Blackwell GPU에서 sm_120a suffix 사용으로 인한 런타임 segfault를 수정한 사례를 분석합니다.#Triton#NVIDIA#GPU#Blackwell#PTX#BugFix2026년 3월 16일댓글 수 로딩 중
[triton] Triton 2CTA Block-Scaled Matmul — cuBLAS 대비 성능 비교Triton Gluon으로 구현한 2CTA warp-specialized block-scaled matmul이 mxfp8/mxfp4/nvfp4를 지원한다#Triton#CUDA#Matrix Multiplication#FP8#Blackwell2026년 3월 13일댓글 수 로딩 중
[triton] Multi-CTA 튜토리얼 추가: CGA 기반 협력 연산NVIDIA Hopper/Blackwell의 CGA(Cooperative Grid Array)를 활용한 multi-CTA 프로그래밍 튜토리얼을 추가한 사례를 분석합니다.#Triton#NVIDIA#GPU#MultiCTA#Tutorial#Blackwell2026년 3월 6일댓글 수 로딩 중
[triton] Gluon tmem_load에서 Register Layout 자동 추론get_tmem_reg_layout 호출을 제거하고 tensor memory descriptor에서 register layout을 자동으로 추론하도록 BC-breaking 변경을 적용한 사례를 분석합니다.#Triton#Gluon#NVIDIA#Blackwell#TensorMemory2026년 2월 28일댓글 수 로딩 중
[pytorch] CI: vLLM 테스트/벤치마크 워크플로우를 CUDA 13.0으로 전환PyTorch의 vLLM 통합 테스트와 벤치마크 워크플로우를 CUDA 12.9에서 13.0으로 전환하고, Blackwell GPU(sm_120) 아키텍처 지원을 추가한 사례를 분석합니다.#PyTorch#vLLM#CI#CUDA#Blackwell#GitHub Actions2026년 2월 25일댓글 수 로딩 중
[triton] Triton Gluon을 활용한 Blackwell 아키텍처에서의 Multi-CTA 행렬 곱셈 최적화Blackwell GPU의 Multi-CTA 환경에서 CLC(Cluster Launch Control)를 활용한 행렬 곱셈 성능 최적화 및 메모리 레이아웃 개선 분석.#Triton#Blackwell#GPU#MatMul#HPC2026년 2월 24일댓글 수 로딩 중
[Triton] 2CTA Block Scale MMA with tcgen05.cp — 두 CTA 협력 행렬 곱셈두 CTA가 협력하는 Block Scale MMA의 전체 경로(TMA→cp→MMA→commit)를 tcgen05.cp 명령으로 구현한다#Triton#NVIDIA#Blackwell#2CTA#MMA#tcgen052026년 2월 23일댓글 수 로딩 중
[Triton] Blackwell 2D activation-scale layout에서 ragged metadata 없이 동작하도록 수정2D 입력 + ragged_metadata=None 조합에서 batched 모드로 fallback하여 레이아웃 구성 실패 방지#Triton#NVIDIA#Blackwell#MXFP#Bug Fix2026년 2월 11일댓글 수 로딩 중
[triton] Blackwell GPU Cluster Launch Control 지원으로 Persistent Kernel 워크로드 밸런싱 구현Triton Gluon에 NVIDIA Blackwell SM100+ GPU의 CLC(Cluster Launch Control) 기능을 추가하여 persistent kernel에서 동적 작업 분배를 가능하게 한 PR을 분석합니다.#Triton#NVIDIA#Blackwell#GPU#Gluon2026년 2월 6일댓글 수 로딩 중
[Triton] M=64 2CTA 모드 지원 추가Blackwell 아키텍처에서 M=64 instruction shape의 2CTA 모드를 지원하여 TensorMemory 레이아웃 유연성 확대#Triton#NVIDIA#Blackwell#CTA#TensorMemory2026년 1월 18일댓글 수 로딩 중
[triton] [Blackwell] NVIDIA 차세대 아키텍처를 위한 Triton의 tcgen05.ld.red 최적화 분석Blackwell 아키텍처의 TMEM 로드 및 리덕션 동시 수행 기능을 Triton Gluon에 구현하여 성능을 최적화한 사례를 분석합니다.#Triton#Blackwell#NVIDIA#GPU#Optimization#MLIR2026년 1월 16일댓글 수 로딩 중
[triton] Triton Blackwell 아키텍처를 위한 MXFP8 입력 스케일 스위즐링 최적화Blackwell GPU에서 MXFP8 행렬 곱셈 시 입력 스케일 스위즐링과 TMA를 도입하여 성능을 1.7배에서 1.1배로 개선했습니다.#Triton#Blackwell#GPU#Optimization#MXFP82025년 12월 2일댓글 수 로딩 중
[triton] Gluon에 mma_scaled 연산 헬퍼 및 실행 테스트 추가Triton Gluon 프론트엔드에 Blackwell tcgen05_mma_scaled 연산을 지원하는 헬퍼 함수와 실행 테스트를 추가한 PR 분석.#Triton#Gluon#Blackwell#MMA#Scaled#TensorCore2025년 10월 9일댓글 수 로딩 중
[Triton] Blackwell barrierSlice 타이핑 버그 수정numStages가 1일 때 barrierSlice 생성에서 발생하는 타입 불일치 버그를 수정#Triton#NVIDIA#Blackwell#Bug Fix#Barrier2025년 10월 9일댓글 수 로딩 중
[triton] tcgen05.cp를 Generic Matrix Descriptor Lowering으로 통합Triton NVIDIA 백엔드에서 tcgen05.cp 명령어의 SMEM 디스크립터 로딩을 generic matrix descriptor lowering 경로로 통합하여 코드 중복을 줄인 PR 분석.#Triton#NVIDIA#Blackwell#MatrixDescriptor#LLVM#Backend2025년 10월 2일댓글 수 로딩 중