[논문리뷰] CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression대부분의 기존 연구는 입력 프롬프트 압축이나 출력 길이 제어 중 하나에만 집중하며, 이를 단순히 Task Accuracy 관점에서만 평가한다 .#Review#Large Language Models#Inference Cost#Prompt Compression#Output Compression#Linguistic Reduction#Semantic Fidelity#Cost Asymmetry2026년 6월 24일댓글 수 로딩 중
[논문리뷰] TokenPilot: Cache-Efficient Context Management for LLM Agents본 논문은 LLM 에이전트의 세션이 길어짐에 따라 발생하는 컨텍스트 누적과 이로 인한 기하급수적인 추론 비용 문제를 해결하고자 합니다. 기존의 텍스트 가지치기(Pruning)나 동적 메모리 제거 기법들은 시퀀스의 레이아웃을 임의로 변경하여 프롬프트 접두사의 연속성을 깨뜨립니다.#Review#LLM Agents#Context Management#Prompt Caching#KV Cache#Inference Cost#Ingestion-Aware Compaction#Lifecycle-Aware Eviction2026년 6월 15일댓글 수 로딩 중