[논문리뷰] LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering본 논문은 Loop Engineering 패러다임 내에서 Large Language Models (LLMs)의 runtime controllers로서의 역량을 효과적으로 평가하기 위한 벤치마크의 필요성을 제기합니다.#Review#Loop Engineering#Benchmarking#Runtime Controllers#Coding Agents#Long-Horizon Tasks#Strict Success Rate#Inference Cost#Loop Contract2026년 8월 30일댓글 수 로딩 중
[논문리뷰] AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents본 연구는 Long-Horizon LLM 에이전트가 겪는 'Context Growth' 문제를 해결하고, 에이전트의 메모리 인터페이스를 체계적으로 평가할 수 있는 통제된 환경을 제공하기 위해 수행되었습니다.#Review#Long-Horizon LLM Agents#Bounded-Memory Contract#Typed Retrieval#AgenticSTS#Slay the Spire 2#Loop Engineering2026년 7월 2일댓글 수 로딩 중