[sglang] SGLang MoE All-Reduce 최적화: NCCL Symmetric Memory 활용으로 지연 시간 50% 단축SGLang MoE 레이어의 all-reduce 성능을 NCCL symmetric memory로 최적화하여 TPOT 6.55% 개선.#SGLang#MoE#AllReduce#NCCL#SymmetricMemory#DeepSeek-V4#성능최적화#GPU2026년 7월 15일댓글 수 로딩 중
[vllm] vLLM의 FlashInfer MNNVL AllReduce RMSNorm 양자화 융합 최적화vLLM에서 FlashInfer의 MNNVL 백엔드를 활용해 AllReduce와 RMSNorm 양자화 융합을 활성화하여 성능을 개선하는 방법.#vLLM#FlashInfer#MNNVL#AllReduce#Optimization2026년 7월 13일댓글 수 로딩 중
[SGLang] 통신 연산: AllReduce, Broadcast, AllGather 구현SGLang의 분산 통신 연산을 분석한다. AllReduce, Broadcast, AllGather 등 집합 통신의 구현, 커스텀 올리듀스와의 연동을 코드와 함께 살펴본다.#sglang#AllReduce#Broadcast#Collective Communication2026년 4월 13일댓글 수 로딩 중
[sglang] SGLang의 AMD AITER AllReduce 최적화: 하드코딩된 제약 제거 및 성능 개선AITER AllReduce+RMSNorm 융합 커널의 하드코딩된 hidden_dim 허용 목록을 제거하고 경계 조건을 최적화하여 범용성과 성능을 개선했습니다.#SGLang#AMD#ROCm#AllReduce#Optimization#LLM2026년 4월 12일댓글 수 로딩 중