[sglang] LLM 서빙 최적화: Gumbel-max 트릭으로 CPU 병목 제거하기 (SGLang 사례)torch.multinomial의 CPU 오버헤드를 Gumbel-max 트릭으로 대체하여 소형 모델의 디코딩 성능을 최대 75% 향상시킨 SGLang의 최적화 기법을 분석합니다.#LLM#SGLang#PyTorch#Optimization#Gumbel-Max#Performance2026년 9월 6일댓글 수 로딩 중