[vllm] vLLM KV Offload 최적화: Tensor Parallelism 환경에서 MLA KV 캐시 복제본 제거하기vLLM에서 Tensor Parallelism 사용 시 MLA KV 캐시 복제본을 제거하여 CPU 메모리 및 D2H 트래픽을 최적화하는 방법을 분석합니다.#vLLM#KV Cache#Offloading#Tensor Parallelism#MLA#Optimization2026년 7월 26일댓글 수 로딩 중