[vllm] vLLM의 /derender 엔드포인트 성능 개선: CPU 작업 오프로딩으로 이벤트 루프 차단 문제 해결vLLM의 /derender 엔드포인트에서 발생하는 CPU 집약적 작업을 별도 스레드 풀로 오프로딩하여 이벤트 루프 차단을 해결하고 응답성을 개선했습니다.#vLLM#성능 최적화#비동기 프로그래밍#멀티스레딩#Python2026년 7월 22일댓글 수 로딩 중
[sglang] [성능 최적화] SGLang `prepare_for_decode`에서 `latest_output_ids` H2D 복사 비동기화로 디코딩 처리량 30% 향상SGLang 디코딩 과정에서 `latest_output_ids`의 H2D 복사를 비동기화하여 성능을 크게 개선한 사례 분석.#SGLang#PyTorch#CUDA#성능 최적화#GPU#LLM#H2D#비동기 프로그래밍2026년 6월 17일댓글 수 로딩 중
[sglang] SGLang 고성능 서빙: 비동기 알림 배치 처리와 SSE 고속 경로 최적화 분석SGLang의 PD 분산 스트리밍 환경에서 CPU 병목 현상을 해결하기 위한 두 가지 핵심 최적화를 분석합니다.#SGLang#성능 최적화#비동기 프로그래밍#SSE#Python#메시지큐#Pydantic#msgspec2026년 4월 22일댓글 수 로딩 중