[논문리뷰] Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches본 연구는 고성능 LLM inference 환경에서 KV Cache의 방대한 메모리 점유와 이에 따른 Latency 증가 문제를 해결하기 위해 Fathom을 제안합니다.#Review#KV Cache#Sparse Decoding#Offloading#Memory Management#Latency Optimization#LLM Inference2026년 9월 16일댓글 수 로딩 중
[vllm] vLLM KV Offload 최적화: Tensor Parallelism 환경에서 MLA KV 캐시 복제본 제거하기vLLM에서 Tensor Parallelism 사용 시 MLA KV 캐시 복제본을 제거하여 CPU 메모리 및 D2H 트래픽을 최적화하는 방법을 분석합니다.#vLLM#KV Cache#Offloading#Tensor Parallelism#MLA#Optimization2026년 7월 26일댓글 수 로딩 중