[sglang] SGLang: LFM2-MoE 모델을 위한 SM90 커널 퓨전 최적화 분석LFM2-MoE의 short-convolution 경로를 Triton 커널로 퓨전하여 연산 병목을 3배 가까이 개선한 사례를 분석합니다.#SGLang#Triton#CUDA#Optimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell 시대를 위한 최적화: FlashInfer의 SM120 Block-Sparse Attention 백엔드 도입기NVIDIA Blackwell(SM120) 아키텍처를 위한 Cake 백엔드 기반 Block-Sparse Attention 최적화로 성능을 11% 향상시킨 사례를 분석합니다.#FlashInfer#CUDA#Blackwell#SM120#Attention#Performance-Optimization2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang, JoyEcho 모델에 Breakable CUDA Graph 적용하여 추론 속도 43% 향상SGLang에서 JoyEcho 모델의 추론 병목 현상을 해결하고 속도를 획기적으로 개선한 Breakable CUDA Graph 적용 사례를 분석합니다.#SGLang#CUDA Graph#최적화#성능 향상#JoyEcho#AI 모델2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: RTX 5090 32GB 환경에서의 CUDA Graph 및 Chunked Prefill 개선RTX 5090 등 32GB GPU 환경에서 CUDA Graph max_bs를 상향하여 고부하 상황의 디코딩 성능 저하를 해결한 사례를 분석합니다.#SGLang#LLM#CUDA#Performance#RTX50902026년 9월 4일댓글 수 로딩 중
[flashinfer] [FlashInfer] Blackwell 아키텍처를 위한 Warp Level Split-K BF16 GEMM 최적화 분석Blackwell(SM100/103) 환경에서 저지연 Decode GEMM 성능을 극대화하기 위한 Warp Split-K 기법과 Autotuner 개선 사항을 살펴봅니다.#CUDA#GEMM#Blackwell#FlashInfer#Performance-Optimization#vLLM2026년 9월 4일댓글 수 로딩 중
[transformers] Hugging Face Transformers, GGUF 추론 속도 향상을 위한 대대적인 리팩토링Hugging Face Transformers 라이브러리가 GGUF 모델 추론 속도 향상을 위해 대대적인 리팩토링을 진행했습니다.#transformers#GGUF#inference#optimization#quantization#llama.cpp#kernels2026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 Fast Start: CUDA IPC를 활용한 모델 가중치 제로 카피 로딩모델 가중치를 GPU 메모리에 상주시키는 데몬을 통해 엔진 재시작 시 디스크 I/O 없이 즉시 로딩하는 최적화 기법을 소개합니다.#vLLM#CUDA#IPC#Optimization#LLM2026년 9월 4일댓글 수 로딩 중
[sglang] MiniMax-H3 모델의 AdaLN 추론 최적화: Pinned-Host 캐싱과 LRU 전략MiniMax-H3 모델의 AdaLN 재구축 비용을 획기적으로 줄이는 Pinned-Host 캐싱 및 LRU 기법 도입#SGLang#Diffusion#Optimization#Caching#MiniMax-H32026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 PLE 메타데이터 전송 최적화: 비동기 전송으로 성능 향상vLLM의 Qwen4Exp PLE 메타데이터 빌더에서 비동기 전송을 사용하여 GPU 커널 간 동기화를 제거하고 성능을 향상시킨 PR 분석.#vLLM#최적화#성능#LLM#GPU#CUDA2026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 작은 배치 사이즈를 위한 Triton 기반 Split-row Top-p 샘플링 최적화작은 배치 환경에서 vLLM의 Top-p 샘플링 성능을 극대화하기 위해 Triton 커널을 재설계하여 효율성을 높였습니다.#vLLM#Triton#CUDA#LLM#Performance2026년 9월 3일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL을 활용한 저지연 GEMM 커널 도입으로 성능 극대화FlashInfer가 CuTe DSL 기반의 저지연 GEMM 커널을 도입하여 FP4/FP8 연산 성능을 혁신적으로 개선했습니다.#FlashInfer#GEMM#CuTe DSL#FP8#FP4#최적화#성능2026년 9월 3일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA: int64 CumSum 연산 9배 가속화 최적화 분석CUB BlockScan을 활용하여 low-lane int64 CumSum 연산을 O(N^2)에서 O(N)으로 개선한 사례 분석#ONNX Runtime#CUDA#GPGPU#Performance#CUB2026년 9월 2일댓글 수 로딩 중
[flashinfer] FlashInfer의 NVFP4 KV 캐시 성능 최적화: FP4 연산의 병목 현상 해소FlashInfer의 NVFP4 KV 캐시 연산에서 발생하는 심각한 성능 병목 현상을 분석하고, CUDA 하드웨어 기능을 활용하여 최적화하는 방법을 기술합니다.#CUDA#GPU#Performance Optimization#FlashInfer#FP4#NVFP4#KV Cache2026년 9월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU int4 가중치 프리패킹 최적화: 병렬 처리 효율성 개선ONNX Runtime에서 int4 양자화 모델 로딩 시 CPU 프리패킹 병렬화를 개선하여 세션 생성 속도를 약 25% 향상시켰습니다.#ONNX Runtime#Performance Optimization#CPU#Quantization#Parallelization2026년 9월 1일댓글 수 로딩 중
[cpython] CPython `PyFloat_Pack/Unpack2` 최적화: 네이티브 `_Float16` 활용으로 성능 향상CPython의 `double`과 `_Float16` 변환 함수가 네이티브 `_Float16` 지원으로 최적화되었습니다.#Python#CPython#Optimization#CAPI#Float16#Performance2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer에 cuTile 기반 Fused MoE 백엔드 도입: 성능과 유지보수성의 균형FlashInfer의 Unified MoE API에 cuTile 백엔드를 추가하여 BF16 및 NVFP4 환경에서 최적화된 MoE 추론을 지원합니다.#FlashInfer#MoE#CUDA#Optimization#LLM2026년 9월 1일댓글 수 로딩 중
[ray] Ray RDT NIXL 메모리 풀 최적화: 불필요한 복사 제거와 전송 효율 극대화Ray의 RDT NIXL 메모리 풀 개선을 통해 텐서 뷰 복사 비용을 줄이고, 전송 디스크립터 병합으로 대규모 텐서 전송 성능을 100배 향상시킨 사례를 분석합니다.#Ray#PyTorch#Memory Management#Performance Optimization#Distributed Computing2026년 9월 1일댓글 수 로딩 중
[flashinfer] FlashInfer SM12x MoE 최적화: 정적 MoE 경로 통합 및 성능 향상FlashInfer의 SM12x 아키텍처에서 정적 MoE 경로를 최적화하고 통합하여 성능을 크게 향상시킨 PR 분석#FlashInfer#MoE#최적화#성능#CUDA#딥러닝2026년 8월 31일댓글 수 로딩 중
[uv] uv의 잠금 파일 의존성 그래프 순회 최적화: 해싱에서 정수 인덱싱으로uv가 잠금 파일 의존성 그래프 순회 시 해싱 비용을 줄이기 위해 정수 인덱싱을 도입한 최적화 분석.#uv#rust#optimization#performance#dependency-resolution#graph-traversal#software-engineering2026년 8월 31일댓글 수 로딩 중