[flashinfer] FlashInfer SM110 XQA 최적화: register_mma_split 도입으로 FP16 Paged Attention 성능 향상NVIDIA Thor GPU를 위한 새로운 register_mma_split 커널을 도입하여 FP16 Paged KV 캐시 환경에서 최대 1.08배 성능 향상을 달성했습니다.#FlashInfer#CUDA#GPU#Attention#Optimization#SM1102026년 9월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, Qwen3-30B 모델의 성능 향상을 위한 CUDA 커널 최적화: L2 캐시 힌트 도입FlashInfer의 Qwen3-30B 모델 추론 성능을 향상시킨 CUDA 커널 최적화 분석#CUDA#Optimization#Deep Learning#LLM#FlashInfer#Qwen3-30B2026년 9월 27일댓글 수 로딩 중
[flashinfer] Hopper(SM90)의 잠재력을 깨우는 Attention 최적화: FlashInfer 'Cake' 백엔드 분석Hopper 아키텍처의 특성을 활용한 Warpgroup 병렬화와 Cluster Barrier 최적화로 Attention 성능을 극대화하는 방법을 알아봅니다.#CUDA#Hopper#SM90#Attention#FlashInfer#Performance Optimization2026년 9월 27일댓글 수 로딩 중
[flashinfer] FlashInfer MiniMax-H3 Attention 최적화: K/V-split을 통한 성능 향상 분석FlashInfer의 MiniMax-H3 Attention 커널에서 K/V-split 기법을 도입하여 성능을 개선한 PR을 분석합니다.#FlashInfer#Attention#Optimization#Performance#CUDA#Deep Learning2026년 9월 26일댓글 수 로딩 중
[flashinfer] FlashInfer NVFP4 QKV GEMM 최적화: SM103a Epilogue 통합 및 CUDA 런처 개선FlashInfer의 NVFP4 QKV GEMM 커널이 SM103a에서 Epilogue 통합으로 성능을 개선하고, CUDA 런처의 디바이스 검증 로직을 최적화했습니다.#CUDA#GPU Optimization#GEMM#FlashInfer#NVFP4#Deep Learning#Performance2026년 9월 26일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell의 잠재력을 극한으로: MiniMax-H3 NVFP4 양자화 및 GEMM 최적화 분석Blackwell 아키텍처에서 NVFP4 양자화 및 TMEM 드레인 최적화를 통해 최대 4배의 성능 향상을 달성한 기법을 살펴봅니다.#CUDA#Blackwell#NVFP4#FlashInfer#Performance-Optimization2026년 9월 26일댓글 수 로딩 중
[flashinfer] FlashInfer Kimi-K3 Fused MoE Router 최적화: Warp-per-row 전략 도입대규모 MoE 라우팅 성능 향상을 위해 Warp-per-row 선택 전략과 Dual-expert 정렬 최적화를 도입하여 B200/GB300에서 최대 1.8배 성능을 개선했습니다.#FlashInfer#MoE#CUDA#GPU Optimization#Performance2026년 9월 26일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell(SM120)을 위한 초고속 커널 최적화: MiniMax-H3 Fused FC1 + SwiGLU 분석RTX 5090 및 Blackwell 아키텍처에서 FP8/NVFP4 양자화를 활용하여 MiniMax-H3 모델의 FC1+SwiGLU 연산을 최대 2.7배 가속화하는 기법을 살펴봅니다.#CUDA#NVIDIA Blackwell#FlashInfer#Deep Learning Optimization#Quantization2026년 9월 25일댓글 수 로딩 중
[vllm] vLLM GLM5.3 성능 최적화: 메타데이터 연산 속도 1.6~4.8배 향상vLLM에서 GLM5.3 모델의 메타데이터 연산 속도를 획기적으로 개선하여 추론 성능을 높인 PR 분석#vLLM#성능 최적화#LLM#GPU#CUDA#Triton2026년 9월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 극한의 최적화: MiniMax-H3 Fused 커널의 256-Column Tiling 전략Blackwell(SM100/103)의 TMEM과 TMA를 활용하여 MiniMax-H3 fused 커널 성능을 최대 32% 향상시킨 Tiling 및 메모리 최적화 기법 분석#CUDA#Blackwell#FlashInfer#GEMM#Optimization#TMA#TMEM2026년 9월 24일댓글 수 로딩 중
[flashinfer] FlashInfer, MTP/Speculative 디코딩 성능 1.23배 향상: Packed-Row 최적화 분석FlashInfer의 실험적인 BF16 GQA 디코딩에서 MTP/Speculative 디코딩 성능을 크게 향상시킨 Packed-Row 최적화 분석#FlashInfer#GPU 최적화#LLM#성능 개선#CUDA2026년 9월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA EP, 2-bit 양자화 GEMM/GEMV 지원 추가로 모델 경량화 가속ONNX Runtime CUDA EP가 2-bit 양자화 가중치 지원을 추가하여 MatMul 연산 성능을 크게 향상시켰습니다.#ONNX Runtime#CUDA#Quantization#GEMM#GEMV#Optimization#Deep Learning2026년 9월 22일댓글 수 로딩 중
[flashinfer] FlashInfer BF16 KDA 성능 최적화: M64 Value Split 도입FlashInfer의 BF16 KDA 연산에서 M64 Value Split을 활용하여 성능을 크게 향상시킨 PR 분석#FlashInfer#AI#성능 최적화#CUDA#BF16#LLM2026년 9월 21일댓글 수 로딩 중
[flashinfer] FlashInfer의 Context-Parallel Decode 최적화: Fused A2A + LSE ReduceNCCL LSA를 활용하여 All-to-All 통신과 LSE 가중치 병합을 하나의 CUDA 커널로 융합해 성능을 극대화한 기술 분석.#FlashInfer#CUDA#NCCL#LLM#Context-Parallel2026년 9월 21일댓글 수 로딩 중
[sglang] HiCache 최적화: TMA를 활용한 Host-Device KV 캐시 전송 성능 2배 향상TMA(Tensor Memory Accelerator)를 도입하여 Host-Device 간 KV 캐시 전송 대역폭을 2배 개선하고 링크 효율을 극대화한 기술 분석.#SGLang#CUDA#TMA#Hicache#Optimization2026년 9월 21일댓글 수 로딩 중
[flashinfer] FlashInfer의 실험적 NVFP4 어텐션 도입: SM103 최적화NVIDIA SM103 아키텍처를 위한 NVFP4 기반의 고성능 어텐션 구현 및 최적화 기법 분석.#FlashInfer#CUDA#NVFP4#Attention#SM103#Optimization2026년 9월 20일댓글 수 로딩 중
[sglang] H200 GPU에서 GLM-5.2 MoE를 위한 W4A8 GEMM 커널 최적화 분석SGLang에서 H200 GPU를 위한 GLM-5.2 MoE 모델의 W4A8 GEMM 커널을 최적화하여 최대 1.23배의 속도 향상을 달성한 PR 분석.#SGLang#GPU 최적화#CUTLASS#MoE#W4A8#H200#GLM-5.2#성능 튜닝#CUDA2026년 9월 19일댓글 수 로딩 중
[sglang] DeepSeek-V4.1 성능 최적화: mHC 및 메타데이터 오버헤드 개선 분석DeepSeek-V4.1의 MoE 및 추론 파이프라인에서 mHC, 메타데이터, 라우터 오버헤드를 최적화하여 5% 이상의 처리량 향상을 달성했습니다.#DeepSeek-V4#SGLang#GPU Optimization#CUDA#MoE2026년 9월 19일댓글 수 로딩 중
[sglang] [DeepSeek-V4.1] Blackwell(SM100) 성능의 한계를 끌어올리는 Fused WO-A 커널 최적화 분석DeepSeek-V4.1 모델의 디코드 성능을 3% 향상시킨 Blackwell 전용 Inverse-RoPE + WO-A + MXFP8 퓨즈드 커널 최적화 기법을 분석합니다.#DeepSeek-V4#Blackwell#CUDA#PTX#Kernel-Fusion#LLM-Optimization2026년 9월 19일댓글 수 로딩 중
[flashinfer] FlashInfer, 최신 GPU 아키텍처를 위한 커널 튜닝으로 성능 극대화FlashInfer가 최신 GPU 아키텍처(SM100/103/107)에 맞춰 커널 튜닝을 통해 qk_rmsnorm 및 fused_add_rmsnorm_quant 성능을 개선했습니다.#GPU#최적화#성능#CUDA#FlashInfer#딥러닝2026년 9월 18일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA 데이터 로딩 최적화: Pinned Buffer와 병렬 I/O를 통한 성능 개선CUDA 외부 데이터 로딩 시 Pinned Buffer와 병렬 읽기를 도입하여 모델 로딩 속도를 최대 29.8% 향상시킨 최적화 기법을 분석합니다.#ONNX Runtime#CUDA#Performance Optimization#Pinned Memory#Parallel I/O2026년 9월 18일댓글 수 로딩 중
[ultralytics] YOLO 학습 성능 25% 향상: B200 GPU 최적화 분석YOLO 학습 파이프라인의 불필요한 GPU 동기화, 메모리 복사 및 초기화 오버헤드를 제거하여 학습 속도를 1.25배 개선한 사례를 분석합니다.#YOLO#PyTorch#Performance#Optimization#CUDA2026년 9월 16일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MoE All-Reduce Fusion 최적화: FlashInfer의 'Cake' 백엔드 분석Blackwell(SM100/103) 환경에서 MoE All-Reduce와 RMSNorm을 융합하여 1.12배 성능 향상을 달성한 FlashInfer의 새로운 최적화 기법을 살펴봅니다.#NVIDIA Blackwell#MoE#All-Reduce#CUDA#FlashInfer#Performance Optimization2026년 9월 16일댓글 수 로딩 중
[onnxruntime] ONNX Runtime, SM90 GPU를 위한 네이티브 FP8 행렬 곱셈 최적화 도입ONNX Runtime이 SM90 GPU에서 MatMulBlockQuantizedFp8Weight 연산자를 위한 네이티브 FP8 행렬 곱셈 경로를 도입하여 성능을 크게 향상시켰습니다.#ONNX Runtime#CUDA#FP8#SM90#DeepGEMM#최적화#성능2026년 9월 16일댓글 수 로딩 중
[flashinfer] [FlashInfer] Paged Attention 최적화: 동일 Stride 구조에서의 주소 계산 오버헤드 제거K와 V의 메모리 레이아웃이 동일할 때 불필요한 주소 계산을 생략하여 성능을 18% 이상 개선한 사례를 분석합니다.#CUDA#FlashAttention#LLM#Optimization#FlashInfer2026년 9월 14일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel: SM90 MoE 통신 최적화 및 안정성 개선SM90 아키텍처에서 MoE 통신을 로컬/인터호스트로 분리 최적화하고, 백워드 동기화 행 문제를 해결하여 성능을 극대화했습니다.#Liger-Kernel#MoE#SM90#CUDA#NVSHMEM#Performance2026년 9월 14일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell W8A8 AlphaMoE Expert 계산 커널 퓨전으로 성능 비약적 향상FlashInfer가 Blackwell GPU에 최적화된 W8A8 MoE Expert 계산 커널 퓨전으로 1.7배 이상 성능을 향상시켰습니다.#FlashInfer#MoE#Blackwell#W8A8#Kernel Fusion#CUDA#Optimization#GPU2026년 9월 13일댓글 수 로딩 중
[vllm] vLLM에 DeepSeek DeepSelect 커널 통합: Sparse Attention 성능 극대화DeepSeek의 고성능 TopK 커널인 DeepSelect를 vLLM에 통합하여 Sparse Attention 인덱서의 추론 성능을 획기적으로 개선했습니다.#vLLM#DeepSeek#DeepSelect#CUDA#SparseAttention#KernelOptimization2026년 9월 13일댓글 수 로딩 중
[flashinfer] FlashInfer, BF16 활성화 및 MXFP8 가중치에 대한 Cake MegaMoE EP16 백엔드 최적화FlashInfer의 실험적인 Cake MegaMoE EP16 백엔드가 BF16 활성화와 MXFP8 가중치에 대해 최적화되어 성능이 향상되었습니다.#FlashInfer#MegaMoE#MXFP8#BF16#최적화#성능#CUDA2026년 9월 12일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 고성능 BF16 x FP4 GEMM 커널 최적화FlashInfer에 NVIDIA Blackwell(SM100/SM103) 전용 BF16 x FP4 GEMM 커널을 추가하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#GEMM#FP4#Optimization2026년 9월 12일댓글 수 로딩 중
[vllm] vLLM Elastic EP의 CUDA Graph 재사용을 통한 리컨피규레이션 다운타임 97% 절감Elastic EP 리컨피규레이션 시 발생하는 CUDA Graph 재캡처 및 커널 웜업 오버헤드를 제거하여 서비스 중단 시간을 획기적으로 줄인 기술 분석.#vLLM#CUDA#LLM#Distributed Systems#Performance Optimization2026년 9월 12일댓글 수 로딩 중
[flashinfer] FlashInfer의 GEMM 성능 혁신: cuTile 백엔드 도입과 최적화 여정FlashInfer가 cuTile 백엔드를 도입하여 GEMM 성능을 극대화하고 견고성을 강화한 과정을 분석합니다.#FlashInfer#GEMM#cuTile#CUDA#성능 최적화#FP8#MoE#GPU 프로그래밍2026년 9월 11일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell(SM103a)을 위한 극한의 커널 퓨전: MiniMax-H3 BF16 Pre-attention 최적화 분석FlashInfer가 Blackwell 아키텍처의 TMA와 Tensor Map을 활용해 Pre-attention 연산을 어떻게 1.44배 가속했는지 분석합니다.#CUDA#Blackwell#FlashInfer#Kernel Fusion#Deep Learning#Performance Optimization2026년 9월 11일댓글 수 로딩 중
[vllm] vLLM의 MLA KV 캐시 최적화: 커널 통합을 통한 성능 극대화vLLM에서 여러 레이어의 FP8 MLA KV 캐시 삽입을 하나의 CUDA 커널로 통합하여 최대 6배 이상의 성능 향상을 달성한 최적화 사례를 분석합니다.#vLLM#CUDA#Optimization#LLM#Performance2026년 9월 11일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: INT4 Paged KV Cache 도입을 통한 메모리 최적화INT4 Paged KV Cache를 도입하여 LLM의 긴 컨텍스트 처리 시 메모리 사용량을 절반으로 줄이고 성능을 극대화했습니다.#ONNX Runtime#CUDA#LLM#Optimization#Quantization2026년 9월 10일댓글 수 로딩 중
[flashinfer] NVFP4 MoE All-to-All 성능 최적화: Phased Dispatch 기법 분석FlashInfer에서 NVFP4 레이아웃의 비대칭 페이로드를 효율적으로 처리하기 위해 도입된 Phased Dispatch 기법과 그 성능 향상 효과를 살펴봅니다.#CUDA#MoE#FlashInfer#Performance Optimization#NVFP4#GPU2026년 9월 8일댓글 수 로딩 중
[vllm] vLLM NVFP4 커널 선택 최적화: SM120/121 환경에서의 성능 향상vLLM에서 NVFP4 모델 실행 시 비효율적인 커널 선택 문제를 해결하여 처리량 23.8% 향상 및 TTFT 36% 단축을 달성한 사례를 분석합니다.#vLLM#LLM#CUDA#Optimization#NVFP4#KernelSelection2026년 9월 8일댓글 수 로딩 중
[flashinfer] FlashInfer NVFP4 KV 타일 리팩(Repack)을 통한 성능 최적화NVFP4 데이터의 소프트웨어 기반 E2M1 변환을 MMA 루프 밖으로 분리하여 커널 성능을 대폭 개선했습니다.#FlashInfer#CUDA#LLM#Optimization#NVFP42026년 9월 7일댓글 수 로딩 중
[sglang] SGLang: LFM2-MoE 모델을 위한 SM90 커널 퓨전 최적화 분석LFM2-MoE의 short-convolution 경로를 Triton 커널로 퓨전하여 연산 병목을 3배 가까이 개선한 사례를 분석합니다.#SGLang#Triton#CUDA#Optimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell 시대를 위한 최적화: FlashInfer의 SM120 Block-Sparse Attention 백엔드 도입기NVIDIA Blackwell(SM120) 아키텍처를 위한 Cake 백엔드 기반 Block-Sparse Attention 최적화로 성능을 11% 향상시킨 사례를 분석합니다.#FlashInfer#CUDA#Blackwell#SM120#Attention#Performance-Optimization2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: RTX 5090 32GB 환경에서의 CUDA Graph 및 Chunked Prefill 개선RTX 5090 등 32GB GPU 환경에서 CUDA Graph max_bs를 상향하여 고부하 상황의 디코딩 성능 저하를 해결한 사례를 분석합니다.#SGLang#LLM#CUDA#Performance#RTX50902026년 9월 4일댓글 수 로딩 중
[flashinfer] [FlashInfer] Blackwell 아키텍처를 위한 Warp Level Split-K BF16 GEMM 최적화 분석Blackwell(SM100/103) 환경에서 저지연 Decode GEMM 성능을 극대화하기 위한 Warp Split-K 기법과 Autotuner 개선 사항을 살펴봅니다.#CUDA#GEMM#Blackwell#FlashInfer#Performance-Optimization#vLLM2026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 Fast Start: CUDA IPC를 활용한 모델 가중치 제로 카피 로딩모델 가중치를 GPU 메모리에 상주시키는 데몬을 통해 엔진 재시작 시 디스크 I/O 없이 즉시 로딩하는 최적화 기법을 소개합니다.#vLLM#CUDA#IPC#Optimization#LLM2026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 PLE 메타데이터 전송 최적화: 비동기 전송으로 성능 향상vLLM의 Qwen4Exp PLE 메타데이터 빌더에서 비동기 전송을 사용하여 GPU 커널 간 동기화를 제거하고 성능을 향상시킨 PR 분석.#vLLM#최적화#성능#LLM#GPU#CUDA2026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 작은 배치 사이즈를 위한 Triton 기반 Split-row Top-p 샘플링 최적화작은 배치 환경에서 vLLM의 Top-p 샘플링 성능을 극대화하기 위해 Triton 커널을 재설계하여 효율성을 높였습니다.#vLLM#Triton#CUDA#LLM#Performance2026년 9월 3일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA: int64 CumSum 연산 9배 가속화 최적화 분석CUB BlockScan을 활용하여 low-lane int64 CumSum 연산을 O(N^2)에서 O(N)으로 개선한 사례 분석#ONNX Runtime#CUDA#GPGPU#Performance#CUB2026년 9월 2일댓글 수 로딩 중
[flashinfer] FlashInfer의 NVFP4 KV 캐시 성능 최적화: FP4 연산의 병목 현상 해소FlashInfer의 NVFP4 KV 캐시 연산에서 발생하는 심각한 성능 병목 현상을 분석하고, CUDA 하드웨어 기능을 활용하여 최적화하는 방법을 기술합니다.#CUDA#GPU#Performance Optimization#FlashInfer#FP4#NVFP4#KV Cache2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer에 cuTile 기반 Fused MoE 백엔드 도입: 성능과 유지보수성의 균형FlashInfer의 Unified MoE API에 cuTile 백엔드를 추가하여 BF16 및 NVFP4 환경에서 최적화된 MoE 추론을 지원합니다.#FlashInfer#MoE#CUDA#Optimization#LLM2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer SM12x MoE 최적화: 정적 MoE 경로 통합 및 성능 향상FlashInfer의 SM12x 아키텍처에서 정적 MoE 경로를 최적화하고 통합하여 성능을 크게 향상시킨 PR 분석#FlashInfer#MoE#최적화#성능#CUDA#딥러닝2026년 8월 31일댓글 수 로딩 중
[sglang] FLUX.2 모델 성능 최적화: Token Concatenation과 NVFP4 양자화의 커널 융합FLUX.2의 BF16 토큰 결합과 NVFP4 양자화를 단일 JIT 커널로 융합하여 2.4%의 추론 속도 향상을 달성했습니다.#SGLang#CUDA#LLM#Optimization#FLUX.2#NVFP42026년 8월 31일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 결정론적 BGMV MoE 최적화NVIDIA Blackwell(SM100) GPU 전용으로 생성된 커널을 통해 BGMV MoE 파이프라인 성능을 최대 4배 이상 향상시켰습니다.#FlashInfer#CUDA#Blackwell#MoE#Performance2026년 8월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA 커널 최적화: Speculative Decoding을 위한 GEMV 확장ONNX Runtime의 CUDA GEMV 커널을 확장하여 Speculative Decoding 시 M=64까지 고성능 경로를 유지하도록 최적화한 사례 분석.#ONNX Runtime#CUDA#GEMV#Speculative Decoding#Performance Optimization2026년 8월 30일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처를 위한 Cake All-Gather Matmul 최적화 분석Blackwell GPU(SM100/103) 환경에서 All-Gather Matmul 성능을 극대화하는 Cake 백엔드 도입 및 최적화 기법을 살펴봅니다.#FlashInfer#CUDA#Blackwell#Matmul#All-Gather#GPU Optimization2026년 8월 29일댓글 수 로딩 중
[onnxruntime] GPU 점유율의 미학: Qwen MTP를 위한 ONNX Runtime NVFP4 GEMV 최적화 분석H200 GPU에서 Qwen 모델의 GEMV 성능을 10% 이상 향상시킨 타일링(Tiling) 및 K-Split 최적화 전략을 심층 분석합니다.#CUDA#ONNXRuntime#Optimization#LLM#Qwen#GPU-Architecture2026년 8월 29일댓글 수 로딩 중
[flashinfer] FlashInfer Blackwell 블록 희소 어텐션 커널 최적화 분석Blackwell 아키텍처를 위한 블록 희소 어텐션 커널의 성능 개선 및 TMA 관리 최적화 사례 분석#FlashInfer#CUDA#Blackwell#Optimization#TMA2026년 8월 28일댓글 수 로딩 중
[vllm] vLLM, CUDA 네이티브 SwiGLU 커널 도입으로 Humming MoE 성능 1.4% 향상vLLM이 Humming MoE에서 CUDA 네이티브 SwiGLU 커널을 사용하여 처리량을 1.4% 개선했습니다.#vLLM#성능 최적화#CUDA#MoE#SwiGLU2026년 8월 27일댓글 수 로딩 중
[vllm] vLLM의 Hopper(SM90) 아키텍처를 위한 GEMM 커널 최적화NVIDIA H200(SM90) GPU에서 Kimi-K3 모델의 GEMM 연산 성능을 최대 1.97배 향상시킨 최적화 사례 분석.#vLLM#GEMM#Hopper#CUDA#PerformanceOptimization2026년 8월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 커널 최적화를 통한 LLM 추론 속도 향상: Recurrence-Piece Persistent M128 도입FlashInfer의 최신 PR은 CUDA 커널 최적화를 통해 LLM 추론 성능을 2.7배 향상시킵니다.#AI#LLM#성능 최적화#CUDA#FlashInfer2026년 8월 26일댓글 수 로딩 중
[sglang] SGLang: LongCat-Image DiT의 FFN 연산 최적화 - Tanh-GELU 퓨전 적용LongCat-Image 모델의 FFN up-projection과 Tanh-GELU를 커널 퓨전하여 추론 성능을 1.5% 개선했습니다.#SGLang#DeepLearning#Optimization#KernelFusion#CUDA2026년 8월 26일댓글 수 로딩 중
[논문리뷰] TorchMorph: CUDA-accelerated Morphological Transforms본 논문은 현대의 GPU 기반 딥러닝 파이프라인에서 기존 CPU 전용 Morphological Transform 라이브러리인 scipy.ndimage가 초래하는 성능 저하와 비효율성을 해결하기 위해 개발되었습니다.#Review#Morphological Transforms#Distance Transform#Optimal Transport#CUDA#PyTorch#Open Source2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 NVFP4 어텐션 최적화: N64 스코어-슬롯 재사용을 통한 성능 향상FlashInfer의 SM120 NVFP4 어텐션 커널을 최적화하여 N64 스코어-슬롯 재사용으로 성능을 크게 향상시켰습니다.#FlashInfer#CUDA#NVIDIA#LLM#최적화#어텐션#NVFP4#SM1202026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer GDN 커널의 SM90/SM120 비-CP 런치 오버헤드 감소 최적화 분석FlashInfer GDN 커널에서 SM90/SM120 GPU의 비-CP 런치 오버헤드를 줄여 성능을 개선한 PR 분석입니다.#FlashInfer#GDN#최적화#성능 개선#CUDA#TVM2026년 8월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 SM100/SM103 최적화: CAKE 기반 블록 희소 어텐션(VSA) 도입CAKE IR을 활용한 SM100/SM103 아키텍처용 고성능 블록 희소 어텐션(VSA) 커널 도입 및 성능 최적화 분석#FlashInfer#CUDA#Attention#Optimization#SM100#CAKE2026년 8월 23일댓글 수 로딩 중
[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[vllm] [vLLM] DFlash2: Speculative Decoding의 새로운 지평 - Local Conv와 Candidate Selector 분석vLLM에 도입된 DFlash2의 핵심 최적화 기법인 Grouped Conv와 Candidate Selector를 심층 분석합니다.#vLLM#Speculative Decoding#Triton#CUDA#LLM Serving2026년 8월 21일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel의 RMSNorm 최적화: cuTile 도입과 CuTe DSL 성능 개선Liger-Kernel에 네이티브 cuTile RMSNorm을 추가하고, CuTe DSL의 동기화 및 연산 효율을 최적화하여 H100 성능을 극대화했습니다.#CUDA#RMSNorm#Liger-Kernel#CuTe#H100#Performance2026년 8월 21일댓글 수 로딩 중
[flashinfer] DeepSeek-V3 라우팅의 혁신: FlashInfer의 Cake 백엔드 가속 분석Blackwell 아키텍처에서 DeepSeek MoE 라우팅 성능을 최대 1.55배 끌어올린 Cake 백엔드의 PTX 최적화 기법을 살펴봅니다.#CUDA#DeepSeek#MoE#FlashInfer#Blackwell#Performance2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer의 PrimTS를 활용한 고성능 Block-Sparse Attention 최적화NVIDIA Blackwell 아키텍처를 위한 Q64/KV256 프로파일 및 Paged Block-Sparse Attention 구현으로 성능 극대화#FlashInfer#Attention#CUDA#GPU#LLM2026년 8월 19일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V3.2 커널의 대규모 토큰 처리 안정성 강화vLLM의 DeepSeek V3.2 커널에서 발생하던 대규모 단일 반복 토큰 처리 오류를 해결하여 안정성을 높였습니다.#vLLM#Triton#CUDA#최적화#딥러닝2026년 8월 18일댓글 수 로딩 중
[sglang] SGLang의 DeepSeek DSA 모델 최적화: Skip-TopK 레이어의 KV 캐시 효율화DeepSeek DSA 모델에서 불필요한 Indexer KV 캐시를 제거하여 메모리 효율을 16% 이상 향상시킨 최적화 사례를 분석합니다.#SGLang#DeepSeek#KV-Cache#LLM-Optimization#CUDA2026년 8월 17일댓글 수 로딩 중
[sglang] Cosmos3 T2I 가속화: QKNorm + RoPE 커널 퓨전과 BF16 정밀도 최적화Cosmos3 모델의 T2I 경로에서 개별적으로 실행되던 QKNorm, RoPE, KV-packing을 하나의 커널로 통합하고, BF16 라운딩 처리를 통해 성능과 정확도를 동시에 잡은 최적화 사례입니다.#CUDA#PyTorch#Kernel-Fusion#Diffusion#SGLang2026년 8월 16일댓글 수 로딩 중
[sglang] SGLang의 MoE Top-K Softmax 커널: AOT에서 JIT로의 효율적인 전환SGLang의 moe_topk_softmax 커널을 AOT에서 JIT 방식으로 전환하여 휠 사이즈를 줄이고 유연성을 확보한 최적화 사례를 분석합니다.#SGLang#CUDA#JIT#MoE#Optimization2026년 8월 16일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA ArgMax/ArgMin 연산 최적화: 대규모 행렬 병렬 처리 개선단일 스레드 기반의 ArgMax/ArgMin 연산을 협력적 병렬 처리로 개선하여 대규모 행렬에서 최대 1000배 이상의 성능 향상을 달성했습니다.#CUDA#ONNX Runtime#GPU Optimization#Performance#Parallel Computing2026년 8월 15일댓글 수 로딩 중
[sglang] [MoE] SwiGLU 퓨전: Triton 커널 최적화로 메모리 대역폭 한계 돌파하기MoE 레이어의 up-GEMM과 활성화 함수를 하나로 합쳐 메모리 오버헤드를 줄이고 추론 속도를 개선한 기법을 분석합니다.#MoE#Triton#CUDA#LLM Optimization#SGLang2026년 8월 14일댓글 수 로딩 중
[flashinfer] Gemma-4를 위한 Blackwell 최적화: FlashInfer의 비대칭 VO-Split NVFP4 구현 분석Gemma-4의 비대칭 헤드 구조(QK=512, VO=256)를 Blackwell GPU에서 NVFP4 KV 캐시로 최적화하는 과정을 살펴봅니다.#FlashInfer#Blackwell#NVFP4#Gemma-4#CUDA#LLM Inference2026년 8월 13일댓글 수 로딩 중
[vllm] vLLM의 성능 병목 해결: Host-to-Device 복사 최적화로 비동기 실행 보장하기vLLM에서 발생하는 비효율적인 H2D 복사 문제를 pinned memory 활용 및 스트라이드 최적화로 해결하여 성능을 개선한 사례를 분석합니다.#vLLM#CUDA#Performance Optimization#PyTorch#Deep Learning2026년 8월 12일댓글 수 로딩 중
[flashinfer] [FlashInfer] CUTLASS MoE 커널 최적화: 벡터화와 동적 스레드 할당으로 성능 한계 돌파하기FlashInfer의 CUTLASS MoE 커널을 벡터화하고 스레드 점유율을 최적화하여 최대 8%의 성능 향상을 달성한 기법을 분석합니다.#CUDA#MoE#FlashInfer#CUTLASS#Optimization#LLM2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer의 GDN 커널 런칭 오버헤드 80% 절감하기: 호스트 측 최적화 전략FlashInfer의 GDN 커널 런칭 오버헤드를 캐싱 전략을 통해 434.7us에서 98.2us로 80% 개선한 사례를 분석합니다.#FlashInfer#CUDA#Optimization#Performance#CUTE2026년 8월 11일댓글 수 로딩 중
[flashinfer] FlashInfer: SM120/SM121 아키텍처를 위한 네이티브 MXFP4 W4A4 Fused MoE 지원Blackwell 아키텍처(SM120)에서 MXFP4 데이터 형식을 활용해 Fused MoE 연산 성능을 최적화하고 처리량을 개선했습니다.#FlashInfer#MoE#MXFP4#Blackwell#CUDA#Optimization2026년 8월 10일댓글 수 로딩 중
[sglang] FLUX.2 모델의 추론 속도 향상: Residual-Gate 커널 최적화FLUX.2 모델의 residual-gate 연산을 전용 CUDA 커널로 통합하여 추론 속도를 약 1.2% 개선했습니다.#SGLang#FLUX.2#CUDA#Optimization#Diffusion2026년 8월 6일댓글 수 로딩 중
[onnxruntime] [CUDA] NVFP4 QMoE GEMV 최적화: ALU 바운드 커널의 한계를 넘어서는 방법NVFP4 양자화 디코딩 속도를 30% 이상 개선하고, MTP 검증 성능을 20배 이상 끌어올린 ONNX Runtime의 최적화 기법을 분석합니다.#CUDA#ONNXRuntime#LLM#Optimization#NVFP4#MoE2026년 8월 6일댓글 수 로딩 중
[flashinfer] [FlashInfer] Kimi K3 모델을 위한 초고속 Fused KDA Decode 커널 분석 (SM100 최적화)FlashInfer가 Kimi K3의 핵심 연산들을 하나의 SM100 전용 커널로 통합하여 vLLM 대비 1.13배의 성능 향상을 달성했습니다.#CUDA#FlashInfer#LLM#Optimization#SM100#CuTe2026년 8월 5일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처 최적화: CAKE 기반 TinyGEMM2 커널 도입Blackwell(SM100/103) 아키텍처를 위한 고성능 TinyGEMM2 커널을 도입하여 추론 성능을 최대 1.79배 향상시켰습니다.#FlashInfer#CUDA#Blackwell#GEMM#PerformanceOptimization2026년 8월 5일댓글 수 로딩 중
[flashinfer] Blackwell NVFP4 양자화 최적화: TMA OOB Zero-fill을 이용한 메모리 복사 오버헤드 제거TMA의 하드웨어 기능을 활용해 비정렬 데이터의 패딩 복사 오버헤드를 제거하고 성능을 72% 개선한 FlashInfer의 최적화 사례를 분석합니다.#FlashInfer#NVIDIA Blackwell#NVFP4#TMA#CUDA#Performance Optimization2026년 8월 4일댓글 수 로딩 중
[sglang] Diffusion DiT 모델의 FFN 성능 최적화: cublasLt GELU Epilogue 융합Diffusion DiT 모델의 FFN 연산에서 GEMM과 GELU를 융합하여 커널 호출 오버헤드를 줄이고 HBM 접근을 최적화했습니다.#Diffusion#CUDA#Optimization#SGLang#Performance2026년 8월 4일댓글 수 로딩 중
[flashinfer] FlashInfer: B200용 최적화된 Recurrent KDA Prefill 백엔드 도입NVIDIA B200(SM100a) 아키텍처를 위한 고성능 Recurrent KDA Prefill 백엔드 추가 및 성능 최적화 분석#FlashInfer#B200#CUDA#KDA#Performance2026년 8월 3일댓글 수 로딩 중
[onnxruntime] [CUDA] QMoE MXFP4/NVFP4 가중치 역양자화 성능 최적화: Coalesced Memory Access의 힘ONNX Runtime의 QMoE 가중치 역양자화 커널을 Coalesced Memory Access 패턴으로 최적화하여 MoE 모델의 추론 속도를 대폭 향상시킨 PR 분석.#CUDA#ONNXRuntime#MoE#Optimization#GPU#DeepLearning#FP4#Dequantization#MemoryAccess2026년 8월 3일댓글 수 로딩 중
[sglang] MiniMax-M3 모델을 위한 FP8 Attention GEMM 최적화 및 성능 개선MiniMax-M3 모델의 FP8 Attention GEMM을 SM100 아키텍처에서 최적화하여 프리필 성능을 최대 66% 향상시켰습니다.#SGLang#FP8#Attention#CUDA#Optimization2026년 8월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[sglang] SGLang Diffusion: 2-rank Ulysses를 위한 CUDA-IPC 기반 Zero-Staging All-to-All 최적화2-rank Ulysses 환경에서 NCCL 대신 CUDA-IPC를 사용하여 데이터 복사 오버헤드를 제거하고 전체 성능을 약 10% 향상시킨 최적화 사례.#SGLang#CUDA#NCCL#Ulysses#Performance2026년 7월 31일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 Causal Attention 최적화: O(1) 디코딩과 글로벌 스케줄링의 힘FlashInfer의 FP8 FMHA v2 커널에서 배치 크기가 클 때 발생하는 병목을 O(1) 디코딩과 글로벌 큐 타일 재배치로 해결하여 최대 5.6x 성능 향상을 달성했습니다.#CUDA#LLM#FlashInfer#Performance#Optimization#FP82026년 7월 31일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 성능 최적화: 불필요한 torch.full 커널 제거로 1.88배 속도 향상DeepSeek-V4의 combine_topk_swa_indices 연산에서 out 텐서를 재사용하여 불필요한 메모리 할당 및 커널 호출을 제거하고 성능을 1.88배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#Performance#Optimization2026년 7월 30일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 모델의 성능을 극적으로 향상시키는 융합 커널과 최적화된 스케줄러 도입FlashInfer가 MoE 모델의 FC1 연산을 융합 커널로 최적화하고, 워프 협력 스케줄러를 도입하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#FP8#MXFP8#CUDA2026년 7월 29일댓글 수 로딩 중
[flashinfer] FlashInfer의 Mixture-of-Experts(MoE) 라우팅 성능 최적화 분석고성능 MoE 워크로드를 위한 TopK 라우팅 최적화: 레지스터 압력 감소 및 병렬화 전략#FlashInfer#CUDA#MoE#Performance#GPU2026년 7월 28일댓글 수 로딩 중
[vllm] [vLLM] Hopper와 Blackwell을 위한 Router GEMM 최적화: DeepSeek-V4와 GLM5.2 성능 극대화하기vLLM에서 MoE 모델의 병목인 Router GEMM을 GPU 아키텍처별로 정밀 튜닝하여 최대 5.8%의 성능 향상을 이끌어낸 과정을 살펴봅니다.#vLLM#CUDA#MoE#DeepSeek-V4#Performance-Tuning#Hopper#Blackwell2026년 7월 27일댓글 수 로딩 중
[sglang] SGLang: HPC-Ops 백엔드에서 BF16 디코딩을 위한 동적 스케줄링 도입HPC-Ops의 동적 스케줄링을 BF16으로 확장하여 불균일한 KV 길이 환경에서 디코딩 성능을 최대 4.3% 향상시켰습니다.#SGLang#LLM#HPC-Ops#Optimization#CUDA2026년 7월 27일댓글 수 로딩 중
[sglang] SGLang NGRAM 성능 최적화: 호스트 기반 트리 링크 유도로 GPU 병목 제거하기NGRAM 추론 시 발생하는 불필요한 GPU-CPU 동기화(readback)를 제거하여 처리량을 8.3% 향상시킨 최적화 사례를 분석합니다.#SGLang#LLM#Speculative Decoding#Performance Optimization#CUDA2026년 7월 25일댓글 수 로딩 중
[sglang] SGLang의 Marlin MoE 커널 최적화: JIT 컴파일 시간 특화와 점유율 기반 스케줄링Marlin MoE 커널의 분기 제거 및 점유율 최적화를 통해 Kimi-K2.7 모델의 Prefill 성능을 약 4% 향상시킨 사례 분석#SGLang#CUDA#Marlin#MoE#Performance2026년 7월 25일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Blackwell (SM120+)에서 NVFP4 QMoE를 위한 네이티브 FP4xFP4 Prefill 최적화ONNX Runtime이 Blackwell GPU에서 NVFP4 QMoE의 FP4xFP4 prefill 경로를 최적화하고, SM120 빌드 오류를 해결한 PR 분석.#ONNXRuntime#CUDA#FP4#Quantization#Blackwell#SM120#CUTLASS#Optimization#MoE2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer SM103 FP4 GEMM 최적화: Store256 및 Fused Epilogue 도입SM103 아키텍처에서 256-bit 정렬 스토어와 Fused F32x2 연산을 통해 FP4 GEMM 성능을 최대 16% 향상시킨 기술적 분석.#FlashInfer#CUDA#GEMM#SM103#Optimization#CUTLASS2026년 7월 23일댓글 수 로딩 중
[llm-compressor] vLLM LLM-Compressor: CUDA OOM 문제 해결을 위한 메모리 핀닝 최적화CUDA OOM을 유발하던 무분별한 메모리 핀닝을 지연 핀닝 방식으로 변경하여 대규모 모델의 AWQ 최적화 안정성을 확보했습니다.#vLLM#LLM-Compressor#CUDA#Memory Management#AWQ#Optimization2026년 7월 23일댓글 수 로딩 중
[flashinfer] FlashInfer MoE All-to-All 최적화: TRT-LLM의 성능 비결을 파헤치다FlashInfer의 MoE All-to-All 통신 최적화 PR을 통해 TRT-LLM의 성능 개선 기법을 분석합니다.#FlashInfer#MoE#All-to-All#CUDA#GPU Optimization#TensorRT-LLM#FP8#PDL2026년 7월 22일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 최적화: 불필요한 커널 실행 제거를 통한 성능 향상DeepSeek-V4의 SparseAttnCompressC128 커널 실행 전 경계 조건을 미리 확인하여 불필요한 연산을 건너뜀으로써 성능을 약 2배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#KernelOptimization#Performance2026년 7월 22일댓글 수 로딩 중
[flashinfer] FlashInfer의 Fused SwiGLU 및 NVFP4 양자화 최적화 분석SwiGLU 연산과 NVFP4 양자화를 하나로 통합하여 메모리 접근을 줄이고 성능을 최대 1.34배 향상시킨 최적화 기법을 소개합니다.#FlashInfer#CUDA#CuTe#Quantization#Performance2026년 7월 21일댓글 수 로딩 중
[sglang] DeepSeek-V3.2를 위한 Native FP8 Sparse MLA 최적화: SGLang DSA 백엔드 통합 분석DeepSeek-V3.2의 추론 성능을 극대화하는 Native FP8 Sparse MLA Prefill 커널의 SGLang 통합 과정과 최적화 기법을 분석합니다.#DeepSeek#SGLang#FP8#MLA#CUDA#Performance-Optimization2026년 7월 19일댓글 수 로딩 중
[ultralytics] MuSGD 최적화: Batched Newton-Schulz와 Fused Kernel로 8배 성능 향상MuSGD 옵티마이저의 Newton-Schulz 연산을 배치화하고 PyTorch foreach 연산을 도입하여 커널 실행 오버헤드를 획기적으로 줄였습니다.#PyTorch#Optimization#DeepLearning#CUDA#Performance2026년 7월 19일댓글 수 로딩 중
[sglang] [SGLang] VLM 추론 성능의 비약적 향상: Cross-request ViT Batching과 Metadata 재사용 기법SGLang에서 여러 VLM 요청의 이미지를 한 번에 처리하고, 불필요한 CPU-GPU 동기화를 제거하여 TTFT를 최대 26% 개선한 최적화 사례를 분석합니다.#VLM#SGLang#LLM-Inference#CUDA#PyTorch#Optimization2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang DFlash 최적화: 호스트-디바이스 동기화 제거를 통한 추론 성능 향상DFlash의 단계별 호스트 동기화를 제거하여 CPU가 한 단계 앞서 실행되도록 최적화, 최대 13%의 토큰 처리량 향상을 달성했습니다.#SGLang#LLM#CUDA#Optimization#Triton2026년 7월 18일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: fpA_intB GEMM 최적화 및 CUDA 그래프 호환성 강화CUDA 환경에서 fpA_intB GEMM을 기본 활성화하고, 프로파일러의 병렬성 및 CUDA 그래프 안정성을 개선한 변경사항을 살펴봅니다.#ONNXRuntime#CUDA#GEMM#Quantization#Performance2026년 7월 17일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS SM100 GEMM 커널 최적화 및 분산 환경 개선 분석NVIDIA Blackwell(SM100) 아키텍처를 위한 GEMM 커널 튜닝과 분산 환경에서의 메모리 관리 최적화 사례를 살펴봅니다.#NVIDIA#CUTLASS#CUDA#GEMM#Blackwell#HPC2026년 7월 16일댓글 수 로딩 중
[sglang] SGLang SM100 CuteDSL Prefill 최적화: State I/O의 커널 퓨전CuteDSL prefill 커널에서 불필요한 state gather/scatter를 제거하고 커널 내에서 직접 I/O를 수행하여 성능을 극대화했습니다.#SGLang#CUDA#Optimization#CuteDSL#SM1002026년 7월 16일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP4 GEMM 최적화: 휴리스틱 개선과 Autotuning 효율화FlashInfer의 mm_fp4(cute-dsl) 연산에서 휴리스틱 기반 랭킹과 Top-N Autotuning을 도입하여 컴파일 시간을 획기적으로 단축했습니다.#FlashInfer#GEMM#CUDA#Optimization#LLM#Autotuning2026년 7월 15일댓글 수 로딩 중
[cutlass] NVIDIA Hopper에서 FP8 GEMM + GELU 퓨전 최적화: CuTe DSL 활용Hopper GPU에서 FP8 GEMM과 GELU를 퓨전하여 성능을 최적화하고 유연성을 확보하는 기술 분석.#NVIDIA#Hopper#CuTeDSL#GEMM#FP8#GELU#Optimization#CUDA#Deep Learning2026년 7월 14일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS CuTeDSL: SM103 Grouped Block-Scaled GEMM 최적화 분석SM103 아키텍처를 위한 Grouped Block-Scaled GEMM 커널 구현과 파이프라인 동기화 오류 해결 사례를 분석합니다.#NVIDIA#CUTLASS#GPU#GEMM#SM103#CUDA2026년 7월 14일댓글 수 로딩 중
[flashinfer] FlashInfer: NVIDIA Blackwell(SM120)을 위한 고성능 FP8 MoE GEMM 최적화NVIDIA SM120 아키텍처에서 CuTe C++를 활용해 FP8 groupwise MoE GEMM을 구현하여 성능을 극대화했습니다.#FlashInfer#CUDA#GEMM#MoE#Blackwell#FP82026년 7월 14일댓글 수 로딩 중
[vllm] vLLM의 ROCm 환경 성능 최적화: CUDA Graph 메모리 프로파일링 비활성화vLLM에서 ROCm 플랫폼의 성능 저하를 방지하기 위해 CUDA Graph 메모리 프로파일링을 다시 비활성화한 사례를 분석합니다.#vLLM#ROCm#CUDA#Performance#GPU2026년 7월 13일댓글 수 로딩 중
[flashinfer] FlashInfer MoE 최적화: PDL 스케줄링 개선 및 GEMM2 균형 잡힌 스토어 구현FlashInfer의 MoE 커널에서 PDL 시작 지연을 줄이고 GEMM2의 부분 타일 스토어를 워프 간 인터리빙하여 성능을 향상시킨 최적화 분석.#FlashInfer#MoE#CUDA#CuTe#GEMM#Performance2026년 7월 11일댓글 수 로딩 중
[flashinfer] FlashInfer, 초저병렬성 환경에서의 CP 델타 규칙 사전 계산 최적화FlashInfer가 초저병렬성 환경에서 CP 델타 규칙 사전 계산 성능을 개선했습니다.#FlashInfer#LLM#최적화#GPU#CUDA2026년 7월 8일댓글 수 로딩 중
[flashinfer] FlashInfer의 BF16 GEMM 성능 극대화: CUDA Graph와 Cold L2 Cache 도입FlashInfer의 SM100 타겟 BF16 GEMM 연산에 CUDA Graph와 Cold L2 Cache를 적용하여 오버헤드를 줄이고 성능 안정성을 확보한 사례를 분석합니다.#FlashInfer#CUDA#GEMM#PerformanceOptimization#GPU2026년 7월 8일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: token_to_req_indices 캐싱을 통한 6배 성능 향상vLLM에서 중복되던 CPU-GPU 간 데이터 복사를 제거하여 커널 성능을 5~6배 개선한 최적화 사례를 분석합니다.#vLLM#LLM#Performance#Optimization#CUDA2026년 7월 6일댓글 수 로딩 중
[flashinfer] FlashInfer의 새로운 TGV GEMM 백엔드: CuTeDSL을 활용한 Blackwell 최적화FlashInfer에 Blackwell 아키텍처를 위한 고성능 TGV GEMM 백엔드가 추가되었습니다. CuTeDSL 기반의 2-CTA 모드로 성능을 극대화합니다.#FlashInfer#GEMM#CUDA#Blackwell#CuTeDSL#GPU Optimization2026년 7월 3일댓글 수 로딩 중
[sglang] DeepSeek NextN을 위한 Fused EH Norm 최적화: 커널 융합으로 성능 극대화하기DeepSeek 모델의 EH Norm 연산을 커널 융합(Kernel Fusion)으로 최적화하여 연산 효율을 대폭 개선했습니다.#SGLang#DeepSeek#CUDA#KernelFusion#Optimization2026년 7월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime QMoE SwiGLU GEMV 최적화: Split-K2 커널로 LLM 추론 가속화ONNX Runtime의 Split-K2 SwiGLU GEMV 커널로 QMoE FC1 레이어 성능을 개선합니다.#ONNXRuntime#CUDA#GEMV#Split-K2#LLM#Optimization#SwiGLU#QMoE2026년 6월 30일댓글 수 로딩 중
[flashinfer] FlashInfer의 TRTLLM-Gen MoE 라우팅 최적화: 레지스터 압박 해소와 성능 극대화MoE 라우팅 커널의 스레드 블록 크기를 동적으로 최적화하여 레지스터 압박을 줄이고 고성능을 달성한 사례 분석.#FlashInfer#MoE#CUDA#GPU Optimization#TRTLLM2026년 6월 29일댓글 수 로딩 중
[vllm] vLLM의 성능 극대화: Helion 커널을 활용한 fused_qk_norm_rope 최적화vLLM에 Helion 커널을 도입하여 fused_qk_norm_rope 연산 성능을 H100 기준 최대 1.38배 향상시킨 사례 분석.#vLLM#Helion#KernelOptimization#CUDA#LLM2026년 6월 29일댓글 수 로딩 중
[sglang] SGLang LTX-2.3 Diffusion 모델 최적화: Residual-Gate 연산 CUDA Fast Path 도입SGLang LTX-2.3 모델의 핵심 연산인 residual-gate update를 CUDA 커널로 최적화하여 성능을 크게 향상시켰습니다.#SGLang#CUDA#Optimization#Diffusion Models#Deep Learning#Performance2026년 6월 27일댓글 수 로딩 중
[sglang] SGLang, CUDA 그래프 재실행 시 호스트-디바이스 동기화 제거로 성능 향상SGLang에서 CUDA 그래프 재실행 시 불필요한 호스트-디바이스 동기화를 제거하여 GPU 활용률을 높이고 응답 속도를 개선했습니다.#SGLang#CUDA#최적화#성능#LLM2026년 6월 27일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: D2H 복사 연산의 비동기 오버랩 구현SGLang에서 D2H(Device-to-Host) 복사를 별도 스트림으로 분리하여 추론 성능을 향상시킨 최적화 사례 분석.#SGLang#CUDA#Performance#Optimization#LLM2026년 6월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: MoE Router GEMV 최적화 및 Bias Fusion 구현GPT-OSS-20B 모델의 MoE 라우터 성능 향상을 위해 MatMulNBits 커널에 특화된 GEMV 경로와 Bias Fusion을 도입했습니다.#ONNX Runtime#CUDA#MoE#GEMV#Optimization2026년 6월 24일댓글 수 로딩 중
[sglang] [성능 최적화] SGLang `prepare_for_decode`에서 `latest_output_ids` H2D 복사 비동기화로 디코딩 처리량 30% 향상SGLang 디코딩 과정에서 `latest_output_ids`의 H2D 복사를 비동기화하여 성능을 크게 개선한 사례 분석.#SGLang#PyTorch#CUDA#성능 최적화#GPU#LLM#H2D#비동기 프로그래밍2026년 6월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA MoE: 소규모 배치 디코딩을 위한 SoftmaxTopK 라우터 최적화ONNX Runtime CUDA MoE에서 소규모 배치 디코딩 시 SoftmaxTopK 라우터 성능을 개선하는 방법을 기술합니다.#ONNX Runtime#CUDA#MoE#최적화#성능2026년 6월 12일댓글 수 로딩 중
[sglang] SGLang Diffusion 모델의 FP8 GEMM 최적화: 41.5% 성능 향상 달성Ideogram4 모델의 FP8 weight-only linear 연산을 Fused W8A8 FP8 GEMM으로 교체하여 추론 속도를 1.7배 개선했습니다.#SGLang#Diffusion#FP8#GEMM#Optimization#CUDA2026년 6월 11일댓글 수 로딩 중
[sglang] SGLang LTX-2 VAE 디코딩 성능 최적화: channels_last_3d 도입으로 4.5배 속도 향상LTX-2 VAE 디코딩 과정에서 channels_last_3d 메모리 레이아웃을 적용하여 Conv3d 연산 속도를 4.5배 높이고 메모리 사용량을 13.5% 절감했습니다.#SGLang#DeepLearning#Optimization#VAE#CUDA2026년 6월 9일댓글 수 로딩 중
[vllm] vLLM의 GDN 어텐션 최적화: Prefill과 Decode 배치 분리를 통한 2배 성능 향상Mixed 배치에서 Prefill과 Decode를 분리하여 GDN 어텐션 연산 효율을 극대화하고 1.93배의 커널 속도 향상을 달성했습니다.#vLLM#LLM#Performance#Optimization#CUDA#GDN2026년 6월 6일댓글 수 로딩 중
[flashinfer] FlashInfer의 MoE Routing 성능 최적화: Batcher's Odd-Even Merge Sort 도입FlashInfer의 MoE Top-K 연산에서 64비트 리덕션 최적화 및 비-2의 거듭제곱 정렬을 Batcher's 네트워크로 개선하여 성능을 극대화했습니다.#FlashInfer#CUDA#MoE#Optimization#GPU#Sorting2026년 6월 4일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 KV-Cache Prefill 성능 최적화: Repacking 기법을 통한 오버헤드 제거FP8 KV-cache의 dequantization 오버헤드를 BF16 staging buffer로 제거하여 Prefill 성능을 최대 1.3배 향상시켰습니다.#FlashInfer#CUDA#FP8#LLM#Optimization2026년 6월 2일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA Graph: 진정한 비동기 추론을 위한 동기화 지점 제거CUDA Graph Replay 시 강제되던 동기화 지점을 제거하여, IO Binding과 함께 완전한 비동기 GPU 추론 파이프라인을 구축하는 최적화 기법을 소개합니다.#ONNX Runtime#CUDA#Performance Optimization#Async Inference#CUDA Graph2026년 6월 2일댓글 수 로딩 중
[vllm] vLLM의 FP8 Scaled MM 최적화: Padding 제거를 통한 20% 성능 향상vLLM에서 FP8 행렬 곱셈 시 불필요한 Padding을 제거하여 커널 성능을 약 20% 개선한 사례를 분석합니다.#vLLM#CUDA#Optimization#FP8#DeepLearning2026년 6월 1일댓글 수 로딩 중
[vllm] [vLLM 분석] DeepSeek V4의 Sparse FP8 Compressor 커널 최적화: CuteDSL을 통한 성능 극대화vLLM에서 DeepSeek V4의 KV 캐시 압축 효율을 높이기 위해 CuteDSL 커널을 최적화하여 최대 1.67배의 성능 향상을 달성한 과정을 살펴봅니다.#vLLM#DeepSeek-V4#CUDA#CuteDSL#Kernel-Optimization#FP82026년 6월 1일댓글 수 로딩 중
[sglang] SGLang의 KV-Canary JIT 커널 도입: 효율적인 KV 캐시 검증 최적화SGLang에 도입된 KV-Canary JIT 커널을 통해 대규모 언어 모델의 KV 캐시 무결성을 효율적으로 검증하는 방법을 분석합니다.#SGLang#CUDA#JIT#LLM#KV-Cache2026년 5월 31일댓글 수 로딩 중
[sglang] SGLang 스케줄러 최적화: input_ids H2D 지연 처리 및 FutureMap 통합SGLang의 prefill input_ids H2D를 forward stream으로 지연시키고 FutureMap을 통해 입력을 통합하여 스케줄링 효율을 개선했습니다.#SGLang#LLM#Scheduler#Optimization#CUDA2026년 5월 30일댓글 수 로딩 중
[vllm] [vLLM] MiniMax-M2 MoE Gate 최적화: Fused FP32 Kernel로 서빙 성능 32% 향상시키기vLLM에서 MiniMax-M2 모델의 MoE Gate 연산을 Fused Kernel로 최적화하여 저지연 환경의 성능을 대폭 개선한 사례를 분석합니다.#vLLM#CUDA#MoE#Optimization#MiniMax-M2#LLM Serving2026년 5월 30일댓글 수 로딩 중
[sglang] SGLang의 add_constant 커널 최적화: 아키텍처 인지 벡터화(Vectorization) 도입대규모 텐서 연산 시 벡터화된 커널을 사용하여 add_constant 성능을 최대 35% 향상시키는 최적화 기법을 분석합니다.#SGLang#CUDA#KernelOptimization#Vectorization#H2002026년 5월 30일댓글 수 로딩 중
[flashinfer] FlashInfer MLA 커널 최적화: num_heads < 128 환경에서의 성능 극대화Blackwell GPU에서 MLA 디코드 커널의 num_heads < 128 성능을 개선하기 위해 seqlen_q를 헤드 차원으로 폴딩하는 최적화 기법을 소개합니다.#FlashInfer#GPU#MLA#Optimization#Blackwell#CUDA2026년 5월 29일댓글 수 로딩 중
[sglang] [SGLang] Blackwell(B200)에서 Diffusion Attention 성능을 7배 끌어올리는 Triton 커널 최적화 분석PyTorch SDPA의 마스크 처리 한계를 Triton 커널 퓨전과 Varlen FlashAttention으로 극복하여 B200에서 최대 21%의 성능 향상을 달성했습니다.#Triton#FlashAttention#Diffusion#CUDA#Performance Optimization#SGLang2026년 5월 28일댓글 수 로딩 중
[vllm] vLLM의 MoE Permute 최적화: 버퍼 사전 할당을 통한 성능 향상MoE 연산 시 빈번한 메모리 할당을 제거하여 소규모 배치에서 최대 14%의 성능 향상을 달성한 최적화 기법을 분석합니다.#vLLM#MoE#CUDA#PerformanceOptimization#DeepLearning2026년 5월 28일댓글 수 로딩 중
[triton] [Triton] Persistent Matmul 성능을 13% 향상시킨 정교한 Shared Memory 계산 기법 분석Shared Memory 계산 휴리스틱을 개선하여 TF32 Matmul에서 4-stage 파이프라이닝을 활성화하고 GB200 성능을 13% 끌어올린 사례를 분석합니다.#Triton#GPU#CUDA#Matmul#Optimization#Deep Learning2026년 5월 27일댓글 수 로딩 중
[vllm] [vLLM] W4A16 양자화 모델의 호환성 문제 해결: Triton 커널을 활용한 CUDA Fallback 구현Marlin 커널의 정렬 제약으로 인해 실행 불가능했던 W4A16 모델들을 Triton 커널 fallback을 통해 CUDA 환경에서도 지원하도록 개선했습니다.#vLLM#CUDA#Triton#Quantization#LLM Inference#W4A162026년 5월 27일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUTLASS FMHA: BiasLoader 정렬 문제 해결로 안정성 및 호환성 향상ONNX Runtime의 CUTLASS FMHA에서 BiasLoader의 정렬 문제를 해결하여 CUDA 커널의 안정성과 호환성을 개선했습니다.#ONNX Runtime#CUDA#CUTLASS#FMHA#최적화#성능2026년 5월 27일댓글 수 로딩 중
[sglang] SGLang의 MoE 성능 최적화: 512 전문가 모델을 위한 커널 최적화Qwen3.5-397B와 같은 대규모 MoE 모델을 위해 512 전문가를 지원하는 커널 최적화로 성능을 최대 4배 이상 향상시켰습니다.#SGLang#MoE#CUDA#Kernel Optimization#LLM2026년 5월 25일댓글 수 로딩 중
[sglang] [VLM 성능 최적화] Qwen-VL의 자잘한 H2D 오버헤드 줄이기: 단일 대형 전송으로의 전환Qwen-VL 모델에서 발생하는 빈번한 소규모 Host-to-Device(H2D) 전송을 통합하고, 불필요한 CPU 동기화를 제거하여 멀티모달 추론 성능을 개선한 사례를 분석합니다.#VLM#Qwen-VL#CUDA#Performance-Optimization#PyTorch#SGLang2026년 5월 24일댓글 수 로딩 중
[sglang] SGLang VLM 최적화: CUDA IPC Staging 오버헤드 제거를 통한 성능 향상VLM 입력 처리 시 불필요한 CUDA IPC 스테이징을 제거하여 TTFT 및 E2E 지연 시간을 개선한 최적화 사례입니다.#SGLang#VLM#CUDA#Optimization#Performance2026년 5월 24일댓글 수 로딩 중
[triton] Triton Reduce 커널 성능 최적화: Subtiling과 RowIdxs 도입Triton Reduce 커널의 성능을 향상시키기 위해 subtiling과 rowidxs 기법을 도입한 코드 변경 분석.#Triton#Performance Optimization#CUDA#Deep Learning#Kernel Tuning2026년 5월 24일댓글 수 로딩 중
[vllm] vLLM 기술 딥다이브: CUTLASS를 활용한 NVFP4 Linear 커널의 Batch Invariance 최적화vLLM에서 NVFP4 양자화 연산의 배치 크기 독립적 결과(Batch Invariance)를 보장하고 성능을 극대화한 CUTLASS 커널 개선 사례를 분석합니다.#vLLM#CUTLASS#NVFP4#CUDA#Optimization#Blackwell2026년 5월 23일댓글 수 로딩 중
[flashinfer] FlashInfer의 DeepSeek V4 Sparse MLA 최적화 분석DeepSeek V4의 Sparse MLA를 지원하기 위한 커널 최적화 및 가변 Top-K 처리 로직 개선 사항을 분석합니다.#FlashInfer#DeepSeek#CUDA#LLM#Optimization2026년 5월 21일댓글 수 로딩 중
[sglang] SGLang에서 torch.compile을 활용한 Wan 모델 추론 가속화torch.compile을 도입하여 MUSA 및 CUDA 환경에서 Wan 모델의 추론 성능을 최대 1.09배 향상시킨 최적화 사례를 분석합니다.#SGLang#torch.compile#MUSA#CUDA#Optimization2026년 5월 17일댓글 수 로딩 중
[sglang] SGLang의 MLA KV 캐시 쓰기 최적화: TMA Bulk-Store 도입TMA Bulk-Store와 Triton 커널 최적화를 통해 MLA KV 캐시 쓰기 성능을 최대 12배 향상시킨 기술적 여정.#SGLang#CUDA#Triton#LLM#Optimization#TMA2026년 5월 15일댓글 수 로딩 중
[triton] Triton 커널 최적화: Mask Sorting을 통한 Reduction 연산 가속화Triton의 reduction 연산에서 불필요한 루프 반복을 줄이기 위해 마스크를 기준으로 행을 정렬하고 루프 바운드를 최적화하는 기법을 분석합니다.#Triton#GPU Optimization#Deep Learning#CUDA#Kernel Programming2026년 5월 15일댓글 수 로딩 중
[vllm] Blackwell을 위한 새로운 MLA 백엔드: TOKENSPEED_MLA 분석 (DeepSeek R1 최적화)Blackwell(SM100) 아키텍처에서 DeepSeek R1의 MLA 성능을 극대화하는 TOKENSPEED_MLA 백엔드 도입 및 분석.#vLLM#DeepSeek-R1#MLA#Blackwell#CUDA#Performance-Optimization2026년 5월 14일댓글 수 로딩 중
[flashinfer] FlashInfer Mamba SSU 커널 최적화: Async State Prefetching과 Vectorized Load를 통한 성능 혁신FlashInfer의 Mamba SSU 커널이 Async State Prefetching, Vectorized Load 등으로 극적인 성능 향상을 이루었습니다.#FlashInfer#Mamba#SSU#Kernel Optimization#Triton#CUDA#Performance2026년 5월 13일댓글 수 로딩 중
[vllm] vLLM W8W8 그룹 양자화 성능 최적화: 2D-Grid를 통한 Divmod 제거vLLM의 W8W8 그룹 양자화 커널에서 divmod 연산을 2D-grid로 대체하여 성능을 개선합니다.#vLLM#CUDA#GPU 최적화#양자화#성능#divmod#2D-grid2026년 5월 12일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] PagedAttention의 FA 경로 최적화 및 정확성 개선PagedAttention의 FA 경로에서 휴리스틱 기반 max_query_len을 실제 계산값으로 대체하여 성능 향상 및 CUDA 오류를 해결했습니다.#ONNXRuntime#CUDA#FlashAttention#Optimization#LLM2026년 5월 12일댓글 수 로딩 중
[vllm] vLLM의 MLA 성능 극대화: RoPE, KV Cache, q_concat 연산 퓨전 최적화vLLM에서 MLA 모델의 RoPE, KV Cache, q_concat 연산을 하나의 커널로 통합하여 추론 성능을 크게 향상시킨 최적화 기법을 분석합니다.#vLLM#LLM#CUDA#Optimization#MLA#DeepSeek-R12026년 5월 11일댓글 수 로딩 중
[sglang] SGLang의 MHC 파이프라인 최적화: 커널 퓨전과 DeepGemm 도입MHC 파이프라인에서 커널 퓨전과 DeepGemm을 활용해 연산 효율을 극대화하고 HBM 접근을 최소화하여 성능을 개선했습니다.#SGLang#CUDA#Triton#DeepGemm#Optimization2026년 5월 10일댓글 수 로딩 중
[sglang] SGLang의 FP4 GEMM 성능 최적화: CuTe DSL 백엔드 도입SGLang에 FlashInfer의 CuTe DSL 기반 FP4 GEMM 백엔드를 추가하여 SM100 아키텍처에서의 연산 성능을 최적화했습니다.#SGLang#FP4#GEMM#CUDA#CuTe#FlashInfer2026년 5월 9일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: PDL 도입과 안전한 CUDA 동기화로 DSV3.2/GLM-5 가속하기PDL(Programmatic Dependency Launch) 도입과 CUDA 커널의 메모리 배리어 수정을 통해 추론 지연 시간을 개선하고 안정성을 확보했습니다.#CUDA#SGLang#Performance Optimization#LLM Inference#Triton2026년 5월 9일댓글 수 로딩 중
[vllm] vLLM DeepSeek v4 Fused Indexer Q 양자화 커널 최적화: CuteDSL을 활용한 성능 향상vLLM의 DeepSeek v4 Indexer Q 커널을 CuteDSL로 재작성하여 256비트 로드를 활용, 성능을 대폭 개선합니다.#vLLM#DeepSeekV4#CUDA#CuteDSL#KernelOptimization#GPUPerformance#MXFP4#Quantization2026년 5월 9일댓글 수 로딩 중
[flashinfer] FlashInfer의 Per-token NVFP4 Quantization 커널 최적화 분석FlashInfer의 NVFP4 양자화 커널 성능 개선: 블록 사이즈 최적화 및 Fast Math 제어 옵션 도입#FlashInfer#CUDA#Quantization#LLM#Performance2026년 5월 8일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 및 FP8 GEMM 성능 향상을 위한 커널 업데이트FlashInfer의 MoE 및 FP8 GEMM 커널 업데이트를 통해 성능을 최적화하고 호환성을 개선합니다.#FlashInfer#GEMM#MoE#FP8#CUDA#최적화2026년 5월 8일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell SM120을 위한 MoE Short-Decode 최적화 분석FlashInfer의 SM120 MoE 커널 업데이트를 통해 단일 토큰 디코딩 성능을 극대화하는 마이크로 커널 최적화 기법을 살펴봅니다.#CUDA#MoE#Blackwell#Performance#Triton2026년 5월 7일댓글 수 로딩 중
[sglang] DeepSeek-V4를 위한 MXFP4 Marlin MoE 커널 최적화 및 JIT 통합 분석DeepSeek-V4의 MXFP4 양자화 추론을 위해 Marlin MoE 커널을 JIT 경로로 포팅하고 성능을 최적화한 과정을 분석합니다.#LLM#Quantization#CUDA#DeepSeek-V4#SGLang#Marlin2026년 5월 7일댓글 수 로딩 중
[flashinfer] FlashInfer BF16 XQA MLA 커널의 10가지 버그 수정 및 최적화 분석FlashInfer의 BF16 XQA MLA 커널에서 발생한 10가지 치명적인 버그를 수정하고 성능을 개선한 PR을 분석합니다.#FlashInfer#CUDA#Kernel Optimization#BF16#XQA#MLA2026년 5월 7일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 그래프 호환성을 높이고 성능을 최적화하다: TRT-LLM FMHA v2 통합 및 불필요한 H2D 제거FlashInfer가 TRT-LLM FMHA v2를 통합하고 CUDA 그래프 호환성을 개선하여 성능을 최적화한 PR을 분석합니다.#FlashInfer#TRT-LLM#CUDA#최적화#성능#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer: Wide Vector 최적화와 1900줄의 코드 삭제로 달성한 성능 개선gdn_wide_vec_kernel 도입과 불필요한 레거시 커널 제거를 통해 B200에서 최대 82%의 DRAM 대역폭 효율을 달성한 사례를 분석합니다.#CUDA#PyTorch#FlashInfer#Performance-Optimization#LLM2026년 5월 6일댓글 수 로딩 중
[flashinfer] FlashInfer의 DiT 최적화: SageAttention과 Int8/FP8 혼합 정밀도 커널 도입 분석FlashInfer에 DiT 모델 최적화를 위한 SageAttention 스케일링 팩터 지원 및 Int8/FP8 혼합 정밀도 커널이 추가되었습니다.#FlashInfer#CUDA#DiT#SageAttention#Quantization#DeepLearning2026년 5월 1일댓글 수 로딩 중
[sglang] CUDA 그래프 호환성을 위한 LoRA 연산 최적화: 스칼라 할당 대신 슬라이스 제로화 사용CUDA 그래프 캡처를 방해하는 CPU-GPU 동기화 지점을 제거하여 LoRA 연산의 효율성을 높였습니다.#CUDA#PyTorch#Optimization#LoRA#Performance2026년 4월 30일댓글 수 로딩 중
[vllm] vLLM chunk_kda 커널의 숨겨진 상태(h) 레이아웃 불일치 버그 수정 및 정확도 개선vLLM의 chunk_kda 커널에서 h 행렬 레이아웃 불일치 버그를 수정하여 모델 정확도를 크게 개선합니다.#vLLM#CUDA#Triton#Kernel#Bugfix#Deep Learning#Optimization2026년 4월 30일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: torch.cuda.empty_cache() 호출 제어를 통한 가중치 업데이트 병목 해결가중치 업데이트 시 발생하는 불필요한 GPU 캐시 동기화 오버헤드를 제거하여 추론 지연 시간을 개선했습니다.#SGLang#PyTorch#CUDA#Optimization#LLM2026년 4월 25일댓글 수 로딩 중
[flashinfer] FlashInfer의 고성능 분산 연산: All-Gather Matmul 최적화 분석FlashInfer에 추가된 All-gather Matmul 연산은 Push-Wait 알고리즘을 통해 분산 환경에서 GEMM 성능을 극대화합니다.#FlashInfer#Distributed Computing#CUDA#GEMM#Performance Optimization2026년 4월 24일댓글 수 로딩 중
[sglang] SGLang Triton 커널 최적화: libdevice.tanh 도입과 2D Strided Tensor 지원Triton 커널에서 수치적 불안정성을 해결하기 위해 libdevice.tanh를 도입하고, 2D Strided Tensor를 지원하도록 구조를 개선한 사례를 분석합니다.#Triton#CUDA#LLM#SGLang#Optimization#DeepLearning2026년 4월 22일댓글 수 로딩 중
[vllm] vLLM Gemma4 모델의 GPU/CPU 동기화 병목 현상 해결하기: non_blocking 전송의 중요성Gemma4 모델의 임베딩 과정에서 발생하는 불필요한 GPU/CPU 동기화를 제거하여 추론 성능을 최적화한 사례를 분석합니다.#vLLM#Gemma4#CUDA#Performance-Optimization#PyTorch2026년 4월 17일댓글 수 로딩 중
[vllm] vLLM, H100에서의 QKNorm+RoPE 커널 최적화: 더 나은 성능을 위한 동적 워크로드 분배vLLM의 QKNorm+RoPE 융합 커널 성능 개선: 동적 워크로드 분배로 H100에서의 효율성 증대#vLLM#CUDA#Kernel Optimization#H100#Transformer2026년 4월 13일댓글 수 로딩 중
[sglang] SGLang의 성능 향상을 위한 기본 Quantization 커널 최적화: v2 도입SGLang에서 고부하 워크로드 처리를 위해 더 빠른 per-token group quantization v2 커널을 기본값으로 설정한 변경사항을 분석합니다.#SGLang#LLM#Quantization#CUDA#KernelOptimization2026년 4월 11일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: H2D 메모리 복사 병목 해결을 통한 추론 처리량 개선Triton Attention 커널에서 발생하는 불필요한 Host-to-Device(H2D) 메모리 전송을 캐싱 전략으로 제거하여 멀티모달 모델의 추론 성능을 최적화했습니다.#vLLM#CUDA#Performance#Triton#DeepLearning2026년 4월 10일댓글 수 로딩 중
[vLLM] GPUModelRunner: GPU 모델 포워드 패스vLLM v1의 GPUModelRunner가 스케줄러 출력을 받아 GPU에서 모델을 실행하고, KV 캐시 관리, CUDA 그래프 캡처, speculative decoding까지 처리하는 과정을 코드 레벨에서 분석한다.#vllm#GPU#model runner#forward pass#CUDA2026년 4월 7일댓글 수 로딩 중
[sglang] sglang 성능 최적화: torch.compile 퓨전 복원을 통한 TopK 후처리 개선sglang의 TopK 후처리에서 torch.compile 퓨전을 복원하여 성능을 개선한 PR 분석#sglang#performance#optimization#torch.compile#fusion#CUDA2026년 4월 7일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: cuMemcpyBatchAsync를 활용한 KV 캐시 스왑 효율화vLLM에서 KV 캐시 오프로딩 시 발생하는 개별 복사 오버헤드를 cuMemcpyBatchAsync로 통합하여 최대 7.4배의 성능 향상을 달성했습니다.#vLLM#CUDA#Performance#KV-Cache#Optimization2026년 4월 3일댓글 수 로딩 중
[vllm] [vLLM] GPU-CPU 동기화 병목 제거: prepare_chunk_indices 최적화 분석GDN Prefill 과정에서 발생하는 .tolist() 호출에 의한 GPU-CPU 동기화 병목을 제거하여 추론 효율성을 높인 사례를 분석합니다.#vLLM#CUDA#Performance-Optimization#Deep-Learning#Triton2026년 4월 3일댓글 수 로딩 중
[sglang] SGLang의 디코드 성능 향상을 위한 Temperature 및 Softmax 커널 융합Triton 커널을 활용해 Temperature Scaling과 Softmax를 하나로 융합하여 메모리 접근을 최적화하고 디코드 지연 시간을 최대 4배 이상 단축했습니다.#SGLang#Triton#CUDA#LLM#Optimization2026년 4월 2일댓글 수 로딩 중
[sglang] JIT RMSNorm 커널 업데이트 - Blackwell 최적화 및 벤치마크 통합RMSNorm JIT 커널에 Blackwell(32B wide vector) 및 pre-Blackwell(16B double load) 변형을 추가하고 벤치마크를 통합#SGLang#JIT Kernel#RMSNorm#CUDA#Performance2026년 4월 1일댓글 수 로딩 중
[sglang] fused_qknorm_rope 최적화 - interleave RoPE에서 sincosf 중복 제거interleave 방식 RoPE에서 인접 요소 쌍이 동일한 frequency를 공유하는 점을 활용하여 sincosf 호출 횟수를 절반으로 줄임#SGLang#JIT Kernel#CUDA#RoPE#Performance2026년 4월 1일댓글 수 로딩 중
[sglang] sgl-kernel 레거시 경로 대규모 제거: AOT에서 JIT로의 전환 완성SGLang에서 sgl-kernel AOT(Ahead-of-Time) 빌드 의존성 1,708줄을 삭제하고 JIT 커널만 남긴 대규모 정리 분석.#SGLang#sgl-kernel#JIT#AOT#Cleanup#CUDA#C++2026년 4월 1일댓글 수 로딩 중
[triton] Proton CUPTI Graph Replay 힙 증가 재현 테스트 추가CUDA graph replay 중 CUPTI 라이브러리의 메모리 누수를 체계적으로 재현하고 프로파일링하는 테스트 스크립트를 분석합니다.#Triton#Proton#Profiling#CUDA#MemoryLeak2026년 3월 31일댓글 수 로딩 중
[sglang] 멀티프로세스 JIT 컴파일로 Custom All Reduce 테스트 속도 향상SGLang의 custom all reduce 테스트에서 JIT 커널 컴파일을 멀티프로세스로 병렬화하여 테스트 시간을 500초에서 300초로 단축한 최적화 분석.#SGLang#Testing#JIT Compilation#Multiprocessing#All Reduce#CUDA2026년 3월 31일댓글 수 로딩 중
[sglang] CI 테스트 등록 누락 수정: JIT 커널 테스트/벤치마크 파일 등록SGLang CI에서 누락된 JIT 커널 테스트 및 벤치마크 파일 4개에 register_cuda_ci 호출을 추가하여 CI 커버리지를 완성한 분석.#SGLang#CI#JIT Kernel#Testing#CUDA2026년 3월 27일댓글 수 로딩 중
[sglang] Diffusion 모델용 Fused QKNorm+RoPE CUDA 커널 추가SGLang에 Diffusion 모델의 QKNorm과 RoPE를 하나의 CUDA 커널로 융합하여 메모리 접근을 절반으로 줄이는 warp-level 최적화 커널 분석.#SGLang#CUDA#Diffusion#RoPE#RMSNorm#Kernel Fusion#GPU Optimization2026년 3월 27일댓글 수 로딩 중
[sglang] QKNorm Across Heads CUDA 커널 최적화: Q/K 분리로 레지스터 압력 해소SGLang의 qknorm_across_heads CUDA 커널에서 Q와 K를 하나의 블록에서 동시 처리하던 방식을 2D grid로 분리하여 레지스터 사용량과 shared memory를 절반으로 줄인 최적화 분석.#SGLang#CUDA#Kernel Optimization#RMSNorm#Diffusion#GPU2026년 3월 27일댓글 수 로딩 중
[sglang] sgl-kernel Wheel METADATA/WHEEL 태그를 CUDA 파일명과 정렬sgl-kernel의 wheel 빌드에서 파일명에 +cu124 suffix를 추가할 때 내부 METADATA Version과 WHEEL 태그도 함께 수정하여 pip 설치 오류를 해결한 분석.#SGLang#sgl-kernel#Python Packaging#Wheel#CUDA#CI/CD2026년 3월 26일댓글 수 로딩 중
[sglang] SGLang의 FA3 디코드 최적화: get_scheduler_metadata 도입FlashAttention-3의 타일 스케줄링 메타데이터를 사전 계산하여 레이어별 오버헤드를 제거하는 최적화 기법을 분석합니다.#SGLang#FlashAttention#CUDA#Optimization#LLM2026년 3월 25일댓글 수 로딩 중
[sglang] HiSparse 도입: Sparse Attention 모델을 위한 효율적인 KV 캐시 관리HiSparse는 CPU 메모리를 활용해 유휴 KV 캐시를 저장함으로써, DeepSeek-V3와 같은 Sparse Attention 모델의 배치 사이즈와 처리량을 극대화합니다.#SGLang#LLM#KV Cache#Sparse Attention#CUDA2026년 3월 23일댓글 수 로딩 중
[sglang] SGLang의 SM120 FP8 Blockwise GEMM 성능 최적화: Pingpong 스케줄 도입SM120 아키텍처에서 FP8 Blockwise GEMM 연산 시 Pingpong 스케줄을 도입하여 소형 M 사이즈에서 성능을 약 2배 향상시켰습니다.#CUDA#CUTLASS#GEMM#FP8#SGLang#SM1202026년 3월 22일댓글 수 로딩 중
[triton] ConSan Multi-CTA 지원 추가Triton의 Concurrency Sanitizer(ConSan)에 multi-CTA 클러스터 환경 지원을 추가하여, 클러스터 내 여러 CTA가 공유하는 scratch memory 상태를 올바르게 추적하도록 개선한 PR을 분석합니다.#Triton#GPU Compiler#Concurrency Sanitizer#Multi-CTA#CUDA2026년 3월 19일댓글 수 로딩 중
[triton] Triton Gluon을 활용한 고성능 2CTA 블록 스케일 행렬 곱셈 최적화Triton Gluon의 2CTA 워프 전문화 기법을 통해 행렬 곱셈의 연산 강도를 높이고 SMEM 사용량을 최적화하는 방법#Triton#GPU#CUDA#MatMul#HighPerformanceComputing2026년 3월 13일댓글 수 로딩 중
[triton] Triton 2CTA Block-Scaled Matmul — cuBLAS 대비 성능 비교Triton Gluon으로 구현한 2CTA warp-specialized block-scaled matmul이 mxfp8/mxfp4/nvfp4를 지원한다#Triton#CUDA#Matrix Multiplication#FP8#Blackwell2026년 3월 13일댓글 수 로딩 중
[triton] PyTorch 없이 Triton CUDA 백엔드 독립 사용 지원Triton의 CUDA 백엔드에서 PyTorch 의존성을 제거하여, 순수 Python 환경에서도 GPU 커널을 컴파일하고 실행할 수 있도록 한 PR을 분석합니다.#Triton#CUDA#PyTorch#Runtime#Independence2026년 3월 5일댓글 수 로딩 중
[pytorch] CI: Inductor 벤치마크 CI 작업을 CUDA 12.8에서 13.0으로 통합 전환PyTorch Inductor의 CI 벤치마크 워크플로우에서 CUDA 12.8과 13.0 이중 빌드를 CUDA 13.0 단일 빌드로 통합하여 CI 리소스를 절약한 사례를 분석합니다.#PyTorch#CI#CUDA#GitHub Actions#Inductor#Benchmarks2026년 2월 27일댓글 수 로딩 중
[pytorch] CI: vLLM 테스트/벤치마크 워크플로우를 CUDA 13.0으로 전환PyTorch의 vLLM 통합 테스트와 벤치마크 워크플로우를 CUDA 12.9에서 13.0으로 전환하고, Blackwell GPU(sm_120) 아키텍처 지원을 추가한 사례를 분석합니다.#PyTorch#vLLM#CI#CUDA#Blackwell#GitHub Actions2026년 2월 25일댓글 수 로딩 중
[triton] 컴파일된 커널 모듈 명시적 unload 지원Triton 런타임에서 컴파일된 커널 모듈을 명시적으로 unload할 수 있도록 __del__ 메서드와 unload_module 드라이버 함수를 추가한 PR을 분석합니다.#Triton#Runtime#Memory Management#CUDA#HIP2026년 2월 17일댓글 수 로딩 중
[triton] CUDA 가변 인자 Pre-compiled Launcher로 커널 런치 오버헤드 제거Triton의 CUDA/HIP 커널 런처를 Python 문자열 치환 방식에서 C 기반 가변 인자 방식으로 전환하여 런치 오버헤드를 제거한 PR을 분석합니다.#Triton#CUDA#HIP#Runtime#Performance2026년 1월 21일댓글 수 로딩 중
[triton] Triton 커널 최적화: High Occupancy Persistent Matmul 구현을 통한 성능 향상Triton의 Persistent Matmul 커널에서 SM 점유율을 최적화하여 H200 기준 15% 성능 향상을 달성한 사례 분석.#Triton#GPU#CUDA#Optimization#Matmul2026년 1월 20일댓글 수 로딩 중
[triton] Triton PROTON: CUDA 그래프 프로파일링 오버헤드를 줄이고 MsgPack API를 추가하여 성능을 대폭 개선Triton PROTON 라이브러리의 CUDA 그래프 프로파일링 오버헤드를 줄이고 MsgPack 직렬화 API를 추가하여 성능을 3배~10배 향상시킨 코드 변경 분석.#Triton#PROTON#CUDA#Profiling#Optimization#MsgPack#C++#Python2025년 12월 19일댓글 수 로딩 중
[논문리뷰] CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning본 연구의 핵심 목표는 반정밀 일반 행렬 곱셈(HGEMM) CUDA 커널 의 수동 최적화가 어려운 문제를 해결하고, cuBLAS 와 같은 기존의 고도로 최적화된 라이브러리보다 뛰어난 성능을 달성하는 자동화된 최적화 시스템인 CUDA-L2 를 개발하는 것입니다.#Review#CUDA#Matrix Multiplication#Reinforcement Learning#LLMs#Kernel Optimization#HGEMM#GPU Performance#cuBLAS2025년 12월 2일댓글 수 로딩 중