[논문리뷰] RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States본 논문은 self-evolving LLM 에이전트의 메모리 시스템이 경험 누적에 따른 utility 상태 공간의 무한 확장과 이로 인한 MRT 문제라는 이중고에 직면해 있음을 지적합니다.#Review#LLM Agents#Memory Reinforcement Learning#Memory-Reward Trap#Reduced-Order Utility States#Feedback Density#Self-Evolving Memory2026년 8월 10일댓글 수 로딩 중