[vllm] vLLM 멀티모달 처리 성능 개선: MM 전처리를 위한 별도 Executor 도입vLLM에서 멀티모달 요청 처리 시 토크나이저와 MM 전처리 간의 경합을 제거하여 성능을 향상시킵니다.#vLLM#성능 최적화#멀티모달#병렬 처리#Executor2026년 7월 26일댓글 수 로딩 중
[sglang] sglang, 멀티모달 모델 인코더 병렬 처리 최적화: 전체 복제본 활용으로 성능 향상sglang PR 분석: 멀티모달 모델의 텍스트/이미지 인코더 병렬 처리 방식을 개선하여 전체 GPU 복제본을 활용하고 성능을 극대화합니다.#sglang#병렬 처리#최적화#멀티모달#딥러닝2026년 7월 6일댓글 수 로딩 중
[sglang] SGLang, GPU 간 VAE 디코딩 최적화를 통한 이미지 생성 속도 향상SGLang의 최신 PR은 VAE 디코딩 과정을 최적화하여 이미지 생성 속도를 크게 향상시킵니다.#SGLang#AI#이미지 생성#최적화#VAE#병렬 처리#GPU2026년 6월 14일댓글 수 로딩 중
[onnxruntime] ONNX Runtime 스레드 풀의 지능형 대기: Exponential Backoff 도입으로 성능 및 전력 효율성 향상ONNX Runtime 스레드 풀의 스핀 루프에 Exponential Backoff를 도입하여 성능과 전력 효율성을 개선하는 방법을 분석합니다.#ONNX Runtime#성능 최적화#스레드 풀#Exponential Backoff#병렬 처리2026년 4월 24일댓글 수 로딩 중