[uv] macOS에서 uv 캐시 정리가 3.8배 빨라진 비결: getattrlistbulk를 활용한 일괄 메타데이터 조회macOS의 시스템 콜 getattrlistbulk를 사용하여 수만 개의 파일 메타데이터를 한 번에 읽어옴으로써 uv 캐시 정리 성능을 3.8배 향상시킨 최적화 기법을 분석합니다.#Rust#Performance#macOS#Systems Programming#uv2026년 8월 31일댓글 수 로딩 중
[sglang] FLUX.2 모델 성능 최적화: Token Concatenation과 NVFP4 양자화의 커널 융합FLUX.2의 BF16 토큰 결합과 NVFP4 양자화를 단일 JIT 커널로 융합하여 2.4%의 추론 속도 향상을 달성했습니다.#SGLang#CUDA#LLM#Optimization#FLUX.2#NVFP42026년 8월 31일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 결정론적 BGMV MoE 최적화NVIDIA Blackwell(SM100) GPU 전용으로 생성된 커널을 통해 BGMV MoE 파이프라인 성능을 최대 4배 이상 향상시켰습니다.#FlashInfer#CUDA#Blackwell#MoE#Performance2026년 8월 30일댓글 수 로딩 중
[sglang] ROCm 환경에서 BF16 All-Reduce의 수치 안정성 확보하기: QuickReduce의 FP16 Saturation 이슈 해결BF16 데이터를 FP16으로 변환하여 처리할 때 발생하는 Overflow 문제를 하드웨어 클램핑과 Range Guard 스케일링으로 해결한 사례를 분석합니다.#ROCm#GPU#All-Reduce#Optimization#LLM#SGLang2026년 8월 30일댓글 수 로딩 중
[vllm] vLLM의 ROCm 환경에서 듀얼 스트림 디코드를 통한 성능 최적화ROCm 환경에서 듀얼 스트림 디코드를 최적화하여 모델 추론 성능을 향상시키고 특정 모델의 정확도 문제를 해결합니다.#vLLM#ROCm#성능 최적화#듀얼 스트림 디코드#MoE2026년 8월 30일댓글 수 로딩 중
[sglang] SGLang, NVIDIA Blackwell GPU를 위한 Wan2.2 모델의 ML P 연산 최적화NVIDIA Blackwell GPU에서 Wan2.2 모델의 메모리 바운드 연산을 융합하여 성능을 개선합니다.#SGLang#NVIDIA Blackwell#GPU 최적화#MLP#Kernel Fusion#NVFP42026년 8월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA 커널 최적화: Speculative Decoding을 위한 GEMV 확장ONNX Runtime의 CUDA GEMV 커널을 확장하여 Speculative Decoding 시 M=64까지 고성능 경로를 유지하도록 최적화한 사례 분석.#ONNX Runtime#CUDA#GEMV#Speculative Decoding#Performance Optimization2026년 8월 30일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처를 위한 Cake All-Gather Matmul 최적화 분석Blackwell GPU(SM100/103) 환경에서 All-Gather Matmul 성능을 극대화하는 Cake 백엔드 도입 및 최적화 기법을 살펴봅니다.#FlashInfer#CUDA#Blackwell#Matmul#All-Gather#GPU Optimization2026년 8월 29일댓글 수 로딩 중
[triton] Triton GPU 최적화: 스레드 지역성 향상을 위한 Reduce 연산 개선Triton GPU의 Reduce 연산 최적화를 통해 스레드 지역성을 개선하고 성능을 향상시키는 방법을 분석합니다.#Triton#GPU#최적화#성능#컴파일러2026년 8월 29일댓글 수 로딩 중
[onnxruntime] GPU 점유율의 미학: Qwen MTP를 위한 ONNX Runtime NVFP4 GEMV 최적화 분석H200 GPU에서 Qwen 모델의 GEMV 성능을 10% 이상 향상시킨 타일링(Tiling) 및 K-Split 최적화 전략을 심층 분석합니다.#CUDA#ONNXRuntime#Optimization#LLM#Qwen#GPU-Architecture2026년 8월 29일댓글 수 로딩 중
[ultralytics] Ultralytics 추론 성능 극대화: CPU 전처리 병목 해소하기NumPy 기반의 CPU 전처리를 디바이스(GPU) 텐서 연산으로 전환하여 추론 속도를 최대 3배 이상 향상시킨 최적화 사례를 분석합니다.#PyTorch#Optimization#ComputerVision#Performance#Ultralytics2026년 8월 29일댓글 수 로딩 중
[flashinfer] FlashInfer Blackwell 블록 희소 어텐션 커널 최적화 분석Blackwell 아키텍처를 위한 블록 희소 어텐션 커널의 성능 개선 및 TMA 관리 최적화 사례 분석#FlashInfer#CUDA#Blackwell#Optimization#TMA2026년 8월 28일댓글 수 로딩 중
[loki] Go에서 불필요한 String 할당 제거하기: Grafana Loki의 98% Allocation 최적화 사례Grafana Loki에서 인덱스 스트리밍 리더의 성능을 저해하던 불필요한 문자열 할당을 제거하여 메모리 할당량을 98% 줄인 최적화 기법을 살펴봅니다.#Go#Performance#Optimization#GrafanaLoki#MemoryManagement2026년 8월 28일댓글 수 로딩 중
[vllm] vLLM Rust Frontend 최적화: SSE 스트리밍 성능 개선기vLLM의 Rust 서버에서 SSE 스트리밍 시 반복적인 JSON 직렬화와 메모리 할당을 제거하여 처리량과 지연 시간을 획기적으로 개선했습니다.#vLLM#Rust#Performance#SSE#Optimization2026년 8월 28일댓글 수 로딩 중
[triton] Triton FP4 레이아웃 변환 최적화: 불필요한 메모리 할당 및 복사 제거Triton 라이브러리에서 FP4 데이터 타입의 레이아웃 변환 시 발생하는 비효율성을 제거하여 메모리 사용량과 실행 시간을 개선합니다.#Triton#FP4#최적화#메모리 관리#성능 개선2026년 8월 28일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel의 Fused Linear Cross Entropy 성능 최적화: C=16 전략Triton 커널의 메모리 버짓 상수를 조정하여 Fused Linear Cross Entropy 연산의 루프 오버헤드를 획기적으로 줄인 사례 분석.#Triton#LLM#Optimization#Performance#Liger-Kernel2026년 8월 27일댓글 수 로딩 중
[vllm] vLLM, FlashInfer BF16 CuTeDSL GEMM 통합으로 저지연 추론 성능 향상vLLM이 FlashInfer BF16 CuTeDSL GEMM을 통합하여 저지연 추론 성능을 개선했습니다.#vLLM#FlashInfer#BF16#GEMM#최적화#딥러닝 추론2026년 8월 27일댓글 수 로딩 중
[vllm] vLLM, CUDA 네이티브 SwiGLU 커널 도입으로 Humming MoE 성능 1.4% 향상vLLM이 Humming MoE에서 CUDA 네이티브 SwiGLU 커널을 사용하여 처리량을 1.4% 개선했습니다.#vLLM#성능 최적화#CUDA#MoE#SwiGLU2026년 8월 27일댓글 수 로딩 중
[vllm] vLLM의 Hopper(SM90) 아키텍처를 위한 GEMM 커널 최적화NVIDIA H200(SM90) GPU에서 Kimi-K3 모델의 GEMM 연산 성능을 최대 1.97배 향상시킨 최적화 사례 분석.#vLLM#GEMM#Hopper#CUDA#PerformanceOptimization2026년 8월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, CUDA 커널 최적화를 통한 LLM 추론 속도 향상: Recurrence-Piece Persistent M128 도입FlashInfer의 최신 PR은 CUDA 커널 최적화를 통해 LLM 추론 성능을 2.7배 향상시킵니다.#AI#LLM#성능 최적화#CUDA#FlashInfer2026년 8월 26일댓글 수 로딩 중