[vllm] vLLM MoE 성능 최적화: FlashInfer One-Sided Combine을 활용한 메모리 복사 제거FlashInfer의 one-sided combine 기능을 활용해 MoE 출력 텐서의 불필요한 복사 과정을 제거하고 성능을 개선한 사례를 분석합니다.#vLLM#MoE#FlashInfer#Performance#GPU2026년 7월 16일댓글 수 로딩 중
[sglang] SGLang SM100 CuteDSL Prefill 최적화: State I/O의 커널 퓨전CuteDSL prefill 커널에서 불필요한 state gather/scatter를 제거하고 커널 내에서 직접 I/O를 수행하여 성능을 극대화했습니다.#SGLang#CUDA#Optimization#CuteDSL#SM1002026년 7월 16일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP4 GEMM 최적화: 휴리스틱 개선과 Autotuning 효율화FlashInfer의 mm_fp4(cute-dsl) 연산에서 휴리스틱 기반 랭킹과 Top-N Autotuning을 도입하여 컴파일 시간을 획기적으로 단축했습니다.#FlashInfer#GEMM#CUDA#Optimization#LLM#Autotuning2026년 7월 15일댓글 수 로딩 중
[ultralytics] [Ultralytics] NDJSON 변환 최적화: 보안과 성능을 동시에 잡는 설계 전략NDJSON 데이터셋 변환 시 발생하던 경로 보안 취약점과 성능 병목을 해결하고, 8배 빠른 속도를 달성한 Ultralytics의 최적화 기법을 분석합니다.#Python#Ultralytics#Optimization#Security#PathTraversal#Performance2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang에 KDA FlashInfer 백엔드 도입: Blackwell 아키텍처에서의 효율적인 추론FlashInfer KDA 커널을 도입하여 KDA 모델의 추론 성능을 개선하고 MTP(Speculative Decoding)를 위한 target_verify 경로를 구현했습니다.#SGLang#FlashInfer#KDA#Speculative Decoding#LLM Optimization2026년 7월 15일댓글 수 로딩 중
[sglang] SGLang MoE All-Reduce 최적화: NCCL Symmetric Memory 활용으로 지연 시간 50% 단축SGLang MoE 레이어의 all-reduce 성능을 NCCL symmetric memory로 최적화하여 TPOT 6.55% 개선.#SGLang#MoE#AllReduce#NCCL#SymmetricMemory#DeepSeek-V4#성능최적화#GPU2026년 7월 15일댓글 수 로딩 중
[ray] [Ray] gRPC 메트릭 객체 재사용을 통한 GCS 확장성 개선 (13% 성능 향상)gRPC 요청마다 생성되던 메트릭 객체를 프로세스 단위로 싱글톤화하여 GCS 부하를 줄이고 대규모 액터 스케줄링 성능을 13% 개선한 사례를 분석합니다.#Ray#gRPC#Performance Optimization#C++#Distributed Systems2026년 7월 14일댓글 수 로딩 중
[cutlass] NVIDIA Hopper에서 FP8 GEMM + GELU 퓨전 최적화: CuTe DSL 활용Hopper GPU에서 FP8 GEMM과 GELU를 퓨전하여 성능을 최적화하고 유연성을 확보하는 기술 분석.#NVIDIA#Hopper#CuTeDSL#GEMM#FP8#GELU#Optimization#CUDA#Deep Learning2026년 7월 14일댓글 수 로딩 중
[cutlass] NVIDIA CUTLASS CuTeDSL: SM103 Grouped Block-Scaled GEMM 최적화 분석SM103 아키텍처를 위한 Grouped Block-Scaled GEMM 커널 구현과 파이프라인 동기화 오류 해결 사례를 분석합니다.#NVIDIA#CUTLASS#GPU#GEMM#SM103#CUDA2026년 7월 14일댓글 수 로딩 중
[flashinfer] FlashInfer: NVIDIA Blackwell(SM120)을 위한 고성능 FP8 MoE GEMM 최적화NVIDIA SM120 아키텍처에서 CuTe C++를 활용해 FP8 groupwise MoE GEMM을 구현하여 성능을 극대화했습니다.#FlashInfer#CUDA#GEMM#MoE#Blackwell#FP82026년 7월 14일댓글 수 로딩 중
[vllm] vLLM의 ROCm 환경 성능 최적화: CUDA Graph 메모리 프로파일링 비활성화vLLM에서 ROCm 플랫폼의 성능 저하를 방지하기 위해 CUDA Graph 메모리 프로파일링을 다시 비활성화한 사례를 분석합니다.#vLLM#ROCm#CUDA#Performance#GPU2026년 7월 13일댓글 수 로딩 중
[sglang] SGLang, FlashInfer의 CuTe DSL 백엔드 도입으로 NVFP4 양자화 성능 극대화SGLang이 FlashInfer의 최신 CuTe DSL 백엔드를 활용하여 NVFP4 양자화 성능을 크게 향상시킵니다.#SGLang#FlashInfer#NVFP4#양자화#성능 최적화#CuTe DSL#LLM2026년 7월 13일댓글 수 로딩 중
[vllm] vLLM의 FlashInfer MNNVL AllReduce RMSNorm 양자화 융합 최적화vLLM에서 FlashInfer의 MNNVL 백엔드를 활용해 AllReduce와 RMSNorm 양자화 융합을 활성화하여 성능을 개선하는 방법.#vLLM#FlashInfer#MNNVL#AllReduce#Optimization2026년 7월 13일댓글 수 로딩 중
[sglang] SGLang, MoonViT의 최대 시퀀스 길이 메타데이터 재사용으로 성능 개선SGLang의 MoonViT 구현에서 최대 시퀀스 길이 계산 시 GPU-호스트 동기화를 제거하여 성능을 향상시켰습니다.#SGLang#최적화#성능 개선#MoonViT#FlashAttention2026년 7월 12일댓글 수 로딩 중
[axolotl] Axolotl의 SinkGD 최적화: Triton 커널과 스펙트럼 정규화로 성능 극대화SinkGD 옵티마이저에 도입된 Triton 커널, 스펙트럼 정규화, 그리고 MD-sphere 기법을 통한 학습 효율 및 속도 개선 분석.#Axolotl#SinkGD#Triton#DeepLearning#Optimization2026년 7월 12일댓글 수 로딩 중
[vllm] vLLM에서 Qwen MoE 모델의 All-Reduce를 Reduce-Scatter로 최적화하기vLLM의 Qwen MoE 모델에서 불필요한 All-Reduce 연산을 Reduce-Scatter로 대체하여 통신 오버헤드를 줄이고 성능을 개선했습니다.#vLLM#LLM#MoE#Distributed Training#Optimization2026년 7월 12일댓글 수 로딩 중
[vllm] vLLM 하이브리드 모델을 위한 혁신: Partial Prefix Cache Hit 구현 분석vLLM이 하이브리드 모델(Mamba+Attention)에서 물리 블록보다 작은 단위의 캐시 히트를 지원하여 추론 지연시간을 약 30% 단축한 기술적 비결을 살펴봅니다.#vLLM#LLM-Inference#Prefix-Caching#Mamba#Hybrid-Model#Optimization2026년 7월 12일댓글 수 로딩 중
[flashinfer] FlashInfer MoE 최적화: PDL 스케줄링 개선 및 GEMM2 균형 잡힌 스토어 구현FlashInfer의 MoE 커널에서 PDL 시작 지연을 줄이고 GEMM2의 부분 타일 스토어를 워프 간 인터리빙하여 성능을 향상시킨 최적화 분석.#FlashInfer#MoE#CUDA#CuTe#GEMM#Performance2026년 7월 11일댓글 수 로딩 중
[loki] Grafana Loki의 안정성 향상: Circuit Breaker 도입을 통한 트래픽 제어Grafana Loki의 Distributor에 Circuit Breaker를 도입하여 과부하 시 트래픽을 효율적으로 차단하고 시스템 안정성을 확보하는 방법.#Grafana Loki#Go#Circuit Breaker#Distributed Systems#Reliability2026년 7월 10일댓글 수 로딩 중
[ray] [Ray 최적화] 액터 제출 병목 현상 해결: Placement Group 번들 정보 캐싱으로 GCS 부하 줄이기Ray 액터 제출 시 GCS 쿼리 병목을 해결하기 위해 Placement Group 번들 정보를 로컬 캐싱하여 성능을 대폭 개선한 최적화.#Ray#Optimization#Performance#GCS#PlacementGroup#Actor#Scalability#Python2026년 7월 10일댓글 수 로딩 중