[논문리뷰] Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches본 연구는 고성능 LLM inference 환경에서 KV Cache의 방대한 메모리 점유와 이에 따른 Latency 증가 문제를 해결하기 위해 Fathom을 제안합니다.#Review#KV Cache#Sparse Decoding#Offloading#Memory Management#Latency Optimization#LLM Inference2026년 9월 16일댓글 수 로딩 중