[vllm] vLLM의 /derender 엔드포인트 성능 개선: CPU 작업 오프로딩으로 이벤트 루프 차단 문제 해결vLLM의 /derender 엔드포인트에서 발생하는 CPU 집약적 작업을 별도 스레드 풀로 오프로딩하여 이벤트 루프 차단을 해결하고 응답성을 개선했습니다.#vLLM#성능 최적화#비동기 프로그래밍#멀티스레딩#Python2026년 7월 22일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 최적화: 불필요한 커널 실행 제거를 통한 성능 향상DeepSeek-V4의 SparseAttnCompressC128 커널 실행 전 경계 조건을 미리 확인하여 불필요한 연산을 건너뜀으로써 성능을 약 2배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#KernelOptimization#Performance2026년 7월 22일댓글 수 로딩 중
[flashinfer] FlashInfer의 Fused SwiGLU 및 NVFP4 양자화 최적화 분석SwiGLU 연산과 NVFP4 양자화를 하나로 통합하여 메모리 접근을 줄이고 성능을 최대 1.34배 향상시킨 최적화 기법을 소개합니다.#FlashInfer#CUDA#CuTe#Quantization#Performance2026년 7월 21일댓글 수 로딩 중
[sglang] SGLang LongCat-Flash Router GEMM 최적화: HPC-Ops bf16xfp32 커널로 H200에서 최대 4.31배 성능 향상SGLang의 LongCat-Flash 라우터 GEMM을 HPC-Ops 커널로 최적화하여 H200에서 최대 4.31배의 성능 향상을 달성한 과정을 분석합니다.#SGLang#GEMM#HPC-Ops#bf16#fp32#Optimization#DeepLearning#GPU#Hopper2026년 7월 21일댓글 수 로딩 중
[sglang] [SGLang] MoE Prefill의 혁신: DWDP(Distributed Weight Data Parallelism) 도입 분석MoE 모델의 Prefill 단계에서 All-to-All 통신 병목을 제거하고 NVLink를 통한 가중치 프리페칭으로 성능을 극대화하는 DWDP 기법을 살펴봅니다.#LLM#MoE#Distributed Computing#CUDA VMM#SGLang#Performance Optimization2026년 7월 21일댓글 수 로딩 중
[ultralytics] PyTorch EMA 업데이트 최적화: _foreach_lerp_를 활용한 성능 개선ModelEMA 업데이트 시 루프 기반 연산을 batched _foreach_lerp_로 교체하여 성능을 2.2배 향상하고 프로파일링 버그를 해결했습니다.#PyTorch#Performance#Optimization#EMA#DeepLearning2026년 7월 21일댓글 수 로딩 중
[sglang] SGLang ReplaySSM: GDN 추론 최적화 및 메모리 효율 개선ReplaySSM 도입을 통해 GDN 추론 시 불필요한 SSM 상태 저장을 제거하고, Closed-loop Exact Fold로 정확도를 유지하며 메모리를 6.4배 절감했습니다.#SGLang#LLM#SpeculativeDecoding#SSM#Optimization2026년 7월 20일댓글 수 로딩 중
[sglang] DeepSeek-V3.2를 위한 Native FP8 Sparse MLA 최적화: SGLang DSA 백엔드 통합 분석DeepSeek-V3.2의 추론 성능을 극대화하는 Native FP8 Sparse MLA Prefill 커널의 SGLang 통합 과정과 최적화 기법을 분석합니다.#DeepSeek#SGLang#FP8#MLA#CUDA#Performance-Optimization2026년 7월 19일댓글 수 로딩 중
[vllm] vLLM의 대규모 모델 추론을 위한 MRV2 기반 Prefill Context Parallelism(PCP) 도입MLA 모델을 위한 MRV2 기반의 PCPManager를 도입하여 Prefill 연산을 병렬화하고, DCP와 PCP를 직교적으로 분리하여 확장성을 개선했습니다.#vLLM#LLM#MLA#Context Parallelism#Distributed Inference2026년 7월 19일댓글 수 로딩 중
[ultralytics] MuSGD 최적화: Batched Newton-Schulz와 Fused Kernel로 8배 성능 향상MuSGD 옵티마이저의 Newton-Schulz 연산을 배치화하고 PyTorch foreach 연산을 도입하여 커널 실행 오버헤드를 획기적으로 줄였습니다.#PyTorch#Optimization#DeepLearning#CUDA#Performance2026년 7월 19일댓글 수 로딩 중
[openclaw] 프론트엔드 성능 최적화: 엔트리 CSS 번들 다이어트와 코드 스플리팅 전략엔트리 CSS에서 불필요한 스타일을 제거하고 레이지 로딩 모듈로 분리하여 초기 로딩 성능을 42KB에서 36KB로 개선한 사례를 분석합니다.#Frontend#Performance#CSS#CodeSplitting#Optimization2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: 과도한 Prefill CUDA Graph Padding 방지로 TTFT 개선SGLang이 과도한 Prefill CUDA Graph Padding을 방지하여 불필요한 연산을 줄이고 TTFT를 크게 개선한 최적화 과정을 분석합니다.#SGLang#CUDA Graph#LLM Serving#Performance Optimization#Prefill#TTFT#Python#Deep Learning2026년 7월 18일댓글 수 로딩 중
[sglang] [SGLang] VLM 추론 성능의 비약적 향상: Cross-request ViT Batching과 Metadata 재사용 기법SGLang에서 여러 VLM 요청의 이미지를 한 번에 처리하고, 불필요한 CPU-GPU 동기화를 제거하여 TTFT를 최대 26% 개선한 최적화 사례를 분석합니다.#VLM#SGLang#LLM-Inference#CUDA#PyTorch#Optimization2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang DFlash 최적화: 호스트-디바이스 동기화 제거를 통한 추론 성능 향상DFlash의 단계별 호스트 동기화를 제거하여 CPU가 한 단계 앞서 실행되도록 최적화, 최대 13%의 토큰 처리량 향상을 달성했습니다.#SGLang#LLM#CUDA#Optimization#Triton2026년 7월 18일댓글 수 로딩 중
[sglang] SM120 Blackwell에서 DeepSeek-V4 모델 서빙 최적화: FlashInfer MXFP4 MoE 도입 및 메모리 절감SM120 GPU에서 DeepSeek-V4 모델 서빙 시 발생하던 문제를 해결하고 성능을 개선한 PR 분석.#sglang#DeepSeek-V4#SM120#Blackwell#FlashInfer#MXFP4#MoE#최적화#성능 개선#메모리 절감2026년 7월 18일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Arm64 KleidiAI 기반 FP16 GEMM 및 Convolution 최적화Arm64 환경에서 KleidiAI를 활용한 FP16 GEMM 및 Convolution 연산 가속화 및 MLAS API 확장#ONNX Runtime#Arm64#KleidiAI#FP16#Optimization2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: AVX2 및 AVX-VNNI를 위한 2-bit 가중치 CPU 커널 최적화AVX2/AVX-VNNI 환경에서 2-bit 가중치 MatMul 성능을 개선하여 기존 dequant+SGEMM 대비 최대 1.56배 성능 향상을 달성했습니다.#ONNX Runtime#MLAS#AVX2#VNNI#Optimization#MatMul2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: fpA_intB GEMM 최적화 및 CUDA 그래프 호환성 강화CUDA 환경에서 fpA_intB GEMM을 기본 활성화하고, 프로파일러의 병렬성 및 CUDA 그래프 안정성을 개선한 변경사항을 살펴봅니다.#ONNXRuntime#CUDA#GEMM#Quantization#Performance2026년 7월 17일댓글 수 로딩 중
[sglang] SGLang Kimi K2.5/K2.7 멀티모달 인코더-DP 성능 최적화: 이미지 피처 전송 샤딩 및 배치 처리Kimi K2.5/K2.7 모델의 멀티모달 인코더-DP 모드에서 이미지 피처 전송 및 전처리 성능을 획기적으로 개선한 PR 분석.#SGLang#Kimi#멀티모달#성능 최적화#GPU#CUDA IPC#분산 학습#FlashAttention2026년 7월 16일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS SM100 GEMM 커널 최적화 및 분산 환경 개선 분석NVIDIA Blackwell(SM100) 아키텍처를 위한 GEMM 커널 튜닝과 분산 환경에서의 메모리 관리 최적화 사례를 살펴봅니다.#NVIDIA#CUTLASS#CUDA#GEMM#Blackwell#HPC2026년 7월 16일댓글 수 로딩 중