[논문리뷰] FrontierChallenge: Evaluating Scientific Workflow Completion본 논문은 현재 AI 에이전트 벤치마크가 Final Answers, Isolated Programs 또는 단일 도메인에 초점을 맞추고 있어, 복잡하고 이기종(Heterogeneous)적인 과학적 워크플로우를 End-to-End로 완료하는 에이전트의 능력을 충분히 특성화하지 못한다는 문제점을 제기한다.#Review#Scientific Workflow Completion#Large Language Model Agents#Cross-domain Benchmark#End-to-End Evaluation#Pass Rate Metric#Scientific Deliverables2026년 8월 26일댓글 수 로딩 중
[논문리뷰] AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints본 논문은 실세계 복잡한 환경에서 LLM 에이전트가 Progressive Disclosure되는 Dual Constraints 환경 하에서 효과적으로 계획을 수립하고 수정하는 능력이 부족하다는 점을 지적한다.#Review#Large Language Model Agents#Adaptive Planning#Dual Constraints#Progressive Disclosure#Interactive Benchmarking#Constraint-based Planning2026년 6월 4일댓글 수 로딩 중
[논문리뷰] Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning본 논문은 기존의 프롬프트 기반 스프레드시트 에이전트가 실제 비즈니스 환경의 복잡하고 다단계적인 워크플로우를 처리하는 데 한계가 있다는 문제 의식에서 출발한다.#Review#Large Language Model Agents#Reinforcement Learning#Spreadsheet Automation#GRPO#Excel Environment#Domain-Spreadsheet Benchmark2026년 5월 21일댓글 수 로딩 중
[논문리뷰] Mem-π: Adaptive Memory through Learning When and What to Generate본 논문은 기존 LLM 에이전트의 정적인 메모리 검색 패러다임이 갖는 한계를 극복하기 위해 제안되었습니다. 현재의 메모리 증강 에이전트들은 주로 외부 저장소에서 과거의 경험을 검색하는 방식에 의존하지만, 이러한 검색된 데이터는 현재의 에이전트 맥락과 맞지 않거나 지나치게 특수하여 범용성이 떨어지는 문제가 있습니다.#Review#Large Language Model Agents#Generative Memory#Reinforcement Learning#Adaptive Memory#Abstention Policy#Decoupled Policy Optimization2026년 5월 20일댓글 수 로딩 중