[논문리뷰] E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation본 논문은 기존의 에이전트 벤치마크들이 장기적 의존성과 복잡한 시장 역학을 가진 '지속적인' 비즈니스 환경을 제대로 평가하지 못한다는 문제를 해결하고자 합니다. 대부분의 기존 연구는 과업이 종료되는 에피소드 중심이거나, LLM의 확률적 생성에 의존하여 재현성이 부족한 시뮬레이션을 제공하는 한계가 있습니다.#Review#LLM Agents#Long-Horizon#E-Commerce#Deterministic Benchmarking#Autonomous Business Operation#Multi-Store Management2026년 9월 1일댓글 수 로딩 중
[논문리뷰] MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations본 논문은 기존의 LLM Agent 벤치마크들이 단기적인 작업 완수나 즉각적인 피드백 기반의 태스크에 편향되어 있다는 문제를 해결하고자 한다. 실제 환경에서는 상점 운영과 같이 장기적인 전략 수립이 필요하며, 과거의 의사결정이 미래의 선택을 제약하고 피드백이 불균일하게 발생하는 복합적인 상황이 빈번하다.#Review#LLM Agents#Long-Term Coherence#E-Commerce#Order-Level Simulation#Partially Observable Markov Decision Process#Benchmark2026년 8월 4일댓글 수 로딩 중