[논문리뷰] Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements본 논문은 Long-horizon 에이전트 추론 환경에서 기존 Agentic RL이 겪는 심각한 자원 및 구조적 한계를 해결하는 것을 목표로 합니다.#Review#Agentic Reasoning#Evolution Strategies#Long-Horizon#Parameter Efficiency#LLM Fine-Tuning#GPU Memory2026년 8월 18일댓글 수 로딩 중
[vllm] vLLM TurboQuant: KV 캐시 압축으로 LLM 서빙 효율 극대화vLLM의 TurboQuant는 KV 캐시를 압축하여 메모리 사용량을 줄이고 LLM 서빙 효율을 높입니다.#vLLM#LLM#KV Cache#Quantization#Optimization#Triton#GPU Memory2026년 4월 15일댓글 수 로딩 중
[SGLang] GPU Memory Pool: 블록 기반 KV 캐시 메모리 할당SGLang의 GPU Memory Pool을 분석한다. 사전 할당된 GPU 메모리 블록 관리, KV 캐시용 메모리 풀 설계, 동적 할당/해제 전략을 코드와 함께 살펴본다.#sglang#Memory Pool#GPU Memory#Block Allocation2026년 4월 10일댓글 수 로딩 중