[vllm] vLLM, 캐싱 비활성화 시 불필요한 LRU 해시 분할 제거로 디코드 처리량 3.5% 향상vLLM에서 캐싱 비활성화 시 불필요한 LRU 해시 분할 로직을 제거하여 디코드 처리량을 개선한 PR 분석.#vLLM#성능 최적화#LLM#GPU 캐싱#LRU2026년 7월 25일댓글 수 로딩 중
[SGLang] LoRA Eviction: 어댑터 캐시 관리와 퇴거 정책SGLang의 LoRA Eviction 정책을 분석한다. GPU 메모리 한계 내에서 어댑터를 관리하는 캐시 전략, LRU 기반 퇴거, 어댑터 프리로딩을 코드와 함께 살펴본다.#sglang#LoRA Eviction#Adapter Cache#LRU#Memory Management2026년 4월 14일댓글 수 로딩 중
[SGLang] 캐시 Eviction 정책: LRU, LFU, FIFO 비교 분석SGLang의 캐시 Eviction 정책을 분석한다. LRU, LFU, FIFO 등 퇴거 전략의 구현, 각 정책의 장단점과 적용 시나리오를 코드와 함께 비교한다.#sglang#Cache Eviction#LRU#LFU#FIFO2026년 4월 10일댓글 수 로딩 중