[sglang] SGLang, EmbeddingGemma 사전 추론 성능 최적화: CUDA 그래프와 배치 처리의 힘SGLang이 EmbeddingGemma의 사전 추론 성능을 CUDA 그래프와 배치 처리를 통해 획기적으로 개선한 방법을 분석합니다.#SGLang#EmbeddingGemma#성능 최적화#CUDA Graph#Batching#LLM 서빙2026년 7월 27일댓글 수 로딩 중