[sglang] SGLang Diffusion: 2-rank Ulysses를 위한 CUDA-IPC 기반 Zero-Staging All-to-All 최적화2-rank Ulysses 환경에서 NCCL 대신 CUDA-IPC를 사용하여 데이터 복사 오버헤드를 제거하고 전체 성능을 약 10% 향상시킨 최적화 사례.#SGLang#CUDA#NCCL#Ulysses#Performance2026년 7월 31일댓글 수 로딩 중
[sglang] SGLang MoE All-Reduce 최적화: NCCL Symmetric Memory 활용으로 지연 시간 50% 단축SGLang MoE 레이어의 all-reduce 성능을 NCCL symmetric memory로 최적화하여 TPOT 6.55% 개선.#SGLang#MoE#AllReduce#NCCL#SymmetricMemory#DeepSeek-V4#성능최적화#GPU2026년 7월 15일댓글 수 로딩 중
[flashinfer] FlashInfer 분산 오토튜닝 동기화: NCCL 데드락 해결을 위한 전략적 접근분산 환경에서 오토튜닝 시 발생하는 GPU 타이밍 오차로 인한 NCCL 데드락 문제를 ProcessGroup 동기화로 해결합니다.#FlashInfer#Distributed Computing#NCCL#AutoTuning#LLM2026년 7월 10일댓글 수 로딩 중
[SGLang] NCCL & MSCCL++: 집합 통신 라이브러리 통합SGLang의 NCCL과 MSCCL++ 통합을 분석한다. NVIDIA NCCL의 래퍼 구현, Microsoft MSCCL++의 추가 최적화, 라이브러리 선택 전략을 코드와 함께 살펴본다.#sglang#NCCL#MSCCL++#Collective Communication2026년 4월 13일댓글 수 로딩 중