[논문리뷰] Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading본 논문은 기존의 에이전트 벤치마크가 지나치게 단기적인 작업에 치중되어 있으며, 평가 방식이 최종 결과에만 의존한다는 한계를 해결하고자 한다.#Review#Autonomous Agents#Long-Horizon Tasks#Terminal Benchmarks#Dense Reward-Based Grading#Subtask-based Evaluation#Failure Analysis#Agentic Workflow2026년 7월 12일댓글 수 로딩 중