[sglang] SGLang, EmbeddingGemma 사전 추론 성능 최적화: CUDA 그래프와 배치 처리의 힘SGLang이 EmbeddingGemma의 사전 추론 성능을 CUDA 그래프와 배치 처리를 통해 획기적으로 개선한 방법을 분석합니다.#SGLang#EmbeddingGemma#성능 최적화#CUDA Graph#Batching#LLM 서빙2026년 7월 27일댓글 수 로딩 중
[Ray] iter_batches 속도 향상: block ref 해석을 배치 ray.get()으로 전환Ray Data의 resolve_block_refs에서 block ref당 개별 ray.get() 호출을 배치 처리로 전환하여 iter_batches 성능을 개선한 PR 분석.#Ray#Ray Data#Batching#ray.get#iter_batches#Performance2025년 12월 15일댓글 수 로딩 중