[논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation본 논문은 기존의 에이전트 벤치마크들이 장기적 의존성과 복잡한 시장 역학을 가진 '지속적인' 비즈니스 환경을 제대로 평가하지 못한다는 문제를 해결하고자 합니다. 대부분의 기존 연구는 과업이 종료되는 에피소드 중심이거나, LLM의 확률적 생성에 의존하여 재현성이 부족한 시뮬레이션을 제공하는 한계가 있습니다.#Review#LLM Agents#Long-Horizon#E-Commerce#Deterministic Benchmarking#Autonomous Business Operation#Multi-Store Management2026년 9월 1일댓글 수 로딩 중
[논문리뷰] CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents본 논문은 장기적인 상호작용 환경에서 LLM 에이전트의 Reliability가 심각하게 저하되는 문제를 해결하고자 한다 . 기존 에이전트는 복잡한 태스크 수행 중 사소한 실수로 인해 연쇄적인 실패를 경험하며, 일단 발생한 오류는 수정이 어려운 경우가 많다.#Review#LLM Agents#Tool-Calling#Critique-Aware Training#Long-Horizon#Reliability#Agentic Verification#Policy Optimization2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds본 논문은 기존 비디오 생성 모델이 가진 고정된 시간적 윈도우의 한계를 극복하고, 장시간의 내러티브와 상호작용 가능한 세계를 일관되게 생성하기 위한 JoyAI-Echo-1.5를 제안합니다.#Review#Audio-Visual Generation#Long-Horizon#World Modeling#Memory Conditioning#Self-Gradient Forcing#Action Interface#6-DoF2026년 8월 26일댓글 수 로딩 중
[논문리뷰] FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents본 논문은 기존의 LLM 에이전트 벤치마크가 단기적이고 고정된 환경의 작업에만 국한되어, 현실적인 '관리(Management)' 능력을 측정하지 못한다는 한계에서 출발합니다.#Review#Long-Horizon#Management#Multi-Agent#LLM Agents#Benchmark#Behavioral Analysis2026년 8월 19일댓글 수 로딩 중
[논문리뷰] Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements본 논문은 Long-horizon 에이전트 추론 환경에서 기존 Agentic RL이 겪는 심각한 자원 및 구조적 한계를 해결하는 것을 목표로 합니다.#Review#Agentic Reasoning#Evolution Strategies#Long-Horizon#Parameter Efficiency#LLM Fine-Tuning#GPU Memory2026년 8월 18일댓글 수 로딩 중
[논문리뷰] OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution본 논문은 현대의 AI 에이전트가 단발성 작업이 아닌 장기적인(Long-horizon) 워크플로우에서 동작함에 따라 발생하는 누적된 안전성 위협을 규명하고자 합니다 .#Review#Agent Safety#Red Teaming#Environment Evolution#Long-Horizon#Markov Hypergraph#Robustness2026년 8월 12일댓글 수 로딩 중
[논문리뷰] VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?본 논문은 기존의 AI 에이전트 평가 벤치마크들이 대부분 정적이고 단기적인 과업에 치중되어 있어, 실제 일상생활의 복잡성을 제대로 측정하지 못한다는 문제를 제기합니다 .#Review#Agent Evaluation#Long-Horizon#Proactivity#Living World#Benchmarking#LLM#Task Planning2026년 8월 11일댓글 수 로딩 중
[논문리뷰] OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding본 논문은 LLM Agent가 단순한 코딩을 넘어 실제 업무 현장에서 긴 시간 소요되는 오피스 워크플로우를 처리하는 능력을 평가하기 위한 표준화된 벤치마크의 부재 문제를 해결하고자 합니다.#Review#LLM Agents#Office-Suite Tasks#Long-Horizon#Economic Grounding#Benchmark#Productivity#Code-based Verification2026년 7월 29일댓글 수 로딩 중
[논문리뷰] The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation본 연구는 고차원 의사결정이 필요한 Long-Horizon 환경에서 LLM 기반 에이전트가 겪는 계획 수립의 불확실성과 긴 문맥 유지의 어려움을 해결하는 것을 목표로 한다.#Review#Multi-Turn Planning#Long-Horizon#Agentic Distillation#On-Policy Learning#Pre-training#Post-training2026년 7월 27일댓글 수 로딩 중
[논문리뷰] AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report본 논문은 현대 게임 개발의 노동 집약적이고 시간 소모적인 파이프라인을 대체할 수 있는 실시간 상호작용형 가상 세계 생성 모델을 제안한다. 기존의 영상 생성 모델들은 긴 시간 동안 일관성(Consistency)을 유지하거나 사용자의 카메라 조작 및 행동 입력에 실시간으로 반응하는 데 한계를 가지고 있다.#Review#World Modeling#Interactive Generation#Video Diffusion Transformer#Long-Horizon#Autoregressive#Spatiotemporal Memory2026년 7월 21일댓글 수 로딩 중
[논문리뷰] ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU본 논문은 실시간 인터랙티브 환경을 구현하기 위한 비디오 월드 모델의 제어 가능성(Controllability), 일관성(Consistency), 효율성(Efficiency) 간의 결합 문제를 해결하는 데 집중한다.#Review#World Model#Action-Conditioned#Real-Time Inference#Video Generation#Streaming#Long-Horizon#System Co-Design2026년 7월 21일댓글 수 로딩 중
[논문리뷰] QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents본 논문은 Long-horizon LLM Agent의 학습을 저해하는 희소 보상(Sparse Reward) 문제를 해결하기 위한 dense supervision 방법론들을 효율적으로 평가하고자 합니다 .#Review#LLM Agents#Dense Supervision#Reinforcement Learning#Q-alignment#Evaluation Benchmark#Long-Horizon#Training-Free2026년 6월 30일댓글 수 로딩 중
[논문리뷰] Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent본 논문은 에이전트 모델의 성능을 향상시키기 위한 기존의 파라미터 스케일링 전략이 갖는 높은 비용과 재현성 문제를 해결하기 위해 에이전트 호라이즌(Horizon) 확장을 제안합니다 .#Review#Agents-A1#Long-Horizon#Knowledge-Action Graph#Mixture-of-Experts#On-Policy Distillation#Salient Vocabulary Alignment2026년 6월 29일댓글 수 로딩 중
[논문리뷰] CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies본 논문은 기존 LLM 에이전트 벤치마크가 단일 에이전트나 동질적인 환경에 국한되어, 현실적인 경제 시스템의 복잡성을 반영하지 못하는 한계를 해결하고자 한다.#Review#LLM Agents#Long-Horizon#Multi-Agent Economy#Benchmark#Supply Chain#Decision-making2026년 6월 25일댓글 수 로딩 중
[논문리뷰] EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies본 논문은 기존의 VLA 모델이 엄격한 Markovian 가정 하에 작동하여 장기 작업(long-horizon) 중 발생하는 시각 정보의 차단이나 일시적 변화를 적절히 처리하지 못하는 문제를 해결합니다.#Review#Vision-Language-Action Models#Robotic Manipulation#Long-Horizon#Memory-Augmented#Keyframe Evidence Memory#Non-Markovian2026년 6월 23일댓글 수 로딩 중
[논문리뷰] CEO-Bench: Can Agents Play the Long Game?본 논문은 기존의 에이전트 평가 방식이 단기 작업(Short-horizon tasks)에 치우쳐 있어, 실제 세계의 복잡한 의사결정 과정을 검증하지 못한다는 문제 의식에서 출발한다 .#Review#Long-Horizon#Agent Evaluation#Business Simulation#Decision Making#Partial Observability#Strategic Planning#Autonomous Agents2026년 6월 17일댓글 수 로딩 중
[논문리뷰] WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces기존의 컴퓨터 에이전트 평가 벤치마크는 주로 단일 브라우저 기반 작업에 국한되어 있어, 실제 데스크톱 환경의 복잡한 Long-Horizon 작업 수행 능력을 평가하는 데 한계가 있습니다.#Review#Computer-Use Agent#Long-Horizon#Real-World Benchmark#Hybrid Interface#Human-Computer Interaction#Agent Evaluation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis실제 데이터 분석은 단일 단계가 아닌, 긴 세션 동안 상태가 지속적으로 축적되고 변화하는 반복적 과정입니다. 그러나 기존 데이터 분석 벤치마크는 주로 독립적이거나 짧은 인터랙티브 작업만을 평가하여, 복잡한 분석 세션 속에서 상태를 추적하고 수정하는 에이전트의 능력을 충분히 테스트하지 못합니다 .#Review#Agentic Data Analysis#Long-Horizon#State Management#Benchmark#LLM Agents#State-Evolution2026년 5월 31일댓글 수 로딩 중
[논문리뷰] HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon AgentsLong-horizon 과업에서 에이전트가 Sparse Reward 환경 하에 학습할 때, 전통적인 탐색 방법은 최적의 Policy를 수렴하는 데 극도로 긴 시간이 소요됩니다.#Review#Long-Horizon#Self-Distillation#Hindsight Experience Replay#Reinforcement Learning#Sparse Reward#Goal-Conditioned Policy2026년 5월 24일댓글 수 로딩 중
[논문리뷰] LongMINT: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems본 논문은 현재의 memory-augmented agent들이 현실 세계의 복잡하고 진화하는 long-horizon 환경에서 겪는 기억 오류 문제를 해결하고자 한다.#Review#Long-Horizon#Agent Systems#Memory Evaluation#Multi-Target Interference#Retrieval-Augmented Generation#Benchmarking2026년 5월 20일댓글 수 로딩 중
[논문리뷰] CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing기존의 GUI 에이전트는 웹 탐색이나 단순 OS 작업에서는 상당한 진전을 보였으나, 정교한 미디어 후반 작업과 같은 전문적인 창의적 워크플로우에 대한 대응 능력은 거의 검증되지 않았습니다.#Review#GUI Agents#Media Post-Production#Benchmark#Multimodal#Long-Horizon#Grounding#Vibe Cutting2026년 5월 20일댓글 수 로딩 중
[논문리뷰] MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents본 논문은 현재의 GUI agent가 장기적(Long-Horizon) 태스크 수행 시 인터페이스 변화에 따른 태스크 상태를 유지하는 데 한계를 보인다는 점을 문제로 지적합니다.#Review#GUI Agents#Multimodal Memory#Long-Horizon#Memory Control#MLLM#Working Memory#Episodic Memory2026년 5월 18일댓글 수 로딩 중
[논문리뷰] CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?본 논문은 현대 의료 운영 시스템의 핵심 워크플로우인 사전 승인(Prior Authorization), 이용 관리(Utilization Management), 케어 관리(Care Management)를 자동화하려는 AI 에이전트들의 실질적인 한계를 규명합니다.#Review#Healthcare AI#AI Agents#Policy-Rich Workflows#Long-Horizon#Benchmark#Managed-Care Operations#Model Context Protocol2026년 5월 18일댓글 수 로딩 중
[논문리뷰] WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation본 연구는 기존 에이전트 벤치마크가 현실적인 배포 환경을 제대로 반영하지 못하는 한계를 해결하기 위해 수행되었다.#Review#Agent Evaluation#Long-Horizon#Native-Runtime#Multimodal#Reproducible#Hybrid Verification2026년 5월 14일댓글 수 로딩 중
[논문리뷰] MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning본 논문은 기존의 ReAct나 Chain-of-Thought (CoT)와 같은 에이전트 패러다임이 가진 환경 인식의 시간적 역전 문제를 해결하고자 한다 .#Review#LLM Agent#Long-Horizon#Cognitive Map#Affordance Theory#Epistemic Bottleneck#Interactive Agent#Environment Understanding2026년 5월 13일댓글 수 로딩 중
[논문리뷰] PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning본 논문은 기존의 영상 이해 벤치마크가 대부분 단일 시점 정보만으로 해결 가능하거나, 지나치게 논리적 구조에만 치중되어 있어 모델의 실질적인 시각적 추론 능력을 평가하기 어렵다는 문제를 제기한다.#Review#Video Benchmark#Multimodal Reasoning#Perception-Centric#Long-Horizon#Test-Time Thinking2026년 4월 1일댓글 수 로딩 중
[논문리뷰] WorldCompass: Reinforcement Learning for Long-Horizon World Models본 논문은 상호작용적 비디오 기반 세계 모델(world models)의 장기적인 탐색 정확도와 일관성을 향상시키기 위해, 강화 학습(RL) 기반의 후처리 훈련 프레임워크인 WorldCompass 를 제안합니다.#Review#Reinforcement Learning#World Models#Video Generation#Autoregressive Generation#Long-Horizon#Post-training#Diffusion Models#Reward Functions2026년 2월 9일댓글 수 로딩 중