[sglang] NVLink를 활용한 sglang의 DSpark 헤드 최적화: 더 빠른 토큰 생성sglang의 DSpark 헤드에서 NVLink 집단 통신을 활용하여 토큰 생성 속도를 개선하는 방법을 분석합니다.#sglang#NVLink#DSpark#최적화#성능#딥러닝2026년 9월 14일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: flashinfer_nvlink_one_sided 도입vLLM의 MoE 통신 백엔드를 flashinfer_nvlink_one_sided로 기본 설정하여 처리량(Throughput)을 최대 8% 향상시켰습니다.#vLLM#MoE#FlashInfer#NVLink#Performance2026년 8월 26일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP8 양자화 AllReduce를 통한 통신 대역폭 최적화FP8 양자화를 통해 AllReduce 통신량을 절반으로 줄여 대규모 모델 학습의 NVLink 병목을 해결합니다.#FlashInfer#AllReduce#FP8#Quantization#NVLink#Triton2026년 7월 24일댓글 수 로딩 중