[논문리뷰] LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering본 논문은 Loop Engineering 패러다임 내에서 Large Language Models (LLMs)의 runtime controllers로서의 역량을 효과적으로 평가하기 위한 벤치마크의 필요성을 제기합니다.#Review#Loop Engineering#Benchmarking#Runtime Controllers#Coding Agents#Long-Horizon Tasks#Strict Success Rate#Inference Cost#Loop Contract2026년 8월 30일댓글 수 로딩 중