[논문리뷰] BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference본 논문은 LRMs의 고질적인 메모리 병목 현상인 선형적으로 증가하는 KV Cache 문제를 해결하고자 한다. 기존의 KV Cache 압축 기법(예: RPC, R-KV)은 최근 생성된 Query들이 미래의 중요 토큰을 잘 예측할 것이라는 가정에 의존한다.#Review#Large Reasoning Models#KV Cache Compression#Thought Revisiting Tokens#Beacon Queries#Continual FPS#Transformer#Chain-of-Thought2026년 9월 8일댓글 수 로딩 중