[논문리뷰] Agent-Editing World Model: Rethinking World Modeling for LLM Agents
링크: 논문 PDF로 바로 열기
저자: Shuang Sun, Guoxin Chen, Fanzhe Meng, Jia Deng, Huatong Song, Jinhao Jiang, Wayne Xin Zhao, Hongteng Xu, Ji-Rong Wen
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agent-Editing World Model (AEWM): LLM 에이전트의 Reasoning 및 Action이 미래 Task 진행 상황을 어떻게 형성하는지 모델링하고, 환경 Observation 시뮬레이션 대신 에이전트의 상태를 직접 Editing하는 새로운 패러다임의 World Model.
- Action Judge: Pre-execution 상태에서 제안된 Reasoning-Action 쌍이 Task Progress에 대해 Critical, Exploratory, 또는 Noisy 중 어떤 Decision Effect를 가질지 예측하는 AEWM의 구성 요소.
- State Revision: Noisy하다고 판단된 Reasoning-Action 쌍을 현재 상태로부터 더 생산적인 Reasoning 및 Action으로 대체하여 Agent State를 Editing하는 AEWM의 핵심 기능.
- EditAct: Action Judge와 State Revision 기능을 Real Environment Execution과 통합하여, 생산적인 Decision은 유지하고 Noisy한 Decision은 수정하기 위해 에이전트의 Reasoning과 Action을 선택적으로 Editing하는 Inference Process.
- Task-State Contamination: 에이전트가 불확실한 환경을 탐색할 때, 근거 없는 가정을 사실로 받아들이거나, 모순되는 피드백에도 불구하고 오래된 계획을 유지하거나, 부분적인 진행을 완료로 오인하여 Decision을 왜곡하는 고질적인 문제.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Long-Horizon Task를 수행하는 LLM Agent의 성능 향상을 위한 기존 Language World Model의 한계점과 Agent Trajectory에서 발생하는 Task-State Contamination 문제를 제기한다. 기존 World Model들은 일반적으로 환경의 Observation을 예측하여 환경 Dynamics를 학습하지만, 높은 Entropy와 Execution-dependent한 Tool Response를 재구성하는 것은 Real Feedback이 있을 때 제한적인 가치를 제공한다. 오히려 이러한 시뮬레이션은 허구적인 증거를 도입하여 에이전트의 Interpretation이나 후속 Decision에 도움이 되지 않을 수 있다. 또한, 에이전트들은 Task-State Contamination으로 인해 불확실한 환경에서 unsupported assumptions을 사실로 받아들이고, outdated plans를 유지하며, partial progress를 completion으로 오인하는 경향이 있다. 이러한 오류는 History에 지속되고 Locally Plausible한 Action을 통해 증폭되어, Grounded Observation에도 불구하고 후속 Decision을 왜곡한다. 따라서 저자들은 환경 Observation 예측 대신 에이전트의 Interpretation과 Action이 후속 Task Progress에 미치는 영향을 모델링하고 Agent State를 직접 Editing하는 새로운 Language World Model의 필요성을 강조한다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Task-State Contamination 문제를 해결하기 위해 Agent State와 Decision이 미래 Task Progress에 미치는 영향을 모델링하는 Agent-Editing World Model (AEWM)을 제안한다. AEWM은 두 가지 핵심 기능인 Action Judge와 State Revision을 포함한다. Action Judge는 현재 Pre-execution State $s_t$가 주어졌을 때, 제안된 Reasoning-Action 쌍이 Task Progress에 대해 Critical, Exploratory, 또는 Noisy 중 어떤 Decision Effect를 가질지 예측한다. 만약 Decision이 Noisy하다고 판단되면, State Revision은 해당 쌍을 현재 상태에서 생성된 더 효과적인 Reasoning 및 Action ($\widetilde{r}_t$, $\widetilde{a}_t$)으로 대체한다. 이러한 AEWM의 기능은 EditAct 프레임워크를 통해 Agent Inference에 통합되어, 생산적인 Decision은 유지하고 Noisy한 Decision은 수정하기 위해 Pre-execution State를 직접 Editing한다. 이 방법론은 환경 Observation을 시뮬레이션하는 대신 에이전트의 현재 상태를 직접적으로 변경하여 후속 Reasoning의 기반을 수정한다.
AEWM은 Search, Terminal, Software Engineering (SWE)의 세 가지 도메인에서 Mid-training과 Supervised Fine-tuning (SFT)의 2단계 학습을 통해 훈련되며, 자체 개발한 Action Judge benchmark에서 70.5%의 Macro-F1 점수를 달성하여, 가장 강력한 Baseline인 DeepSeek-V4-Pro (59.9%)를 10.6%p 초과하는 성능을 보였다. EditAct는 Qwen3.5-4B, Qwen3.5-9B, Qwen3.5-35B-A3B의 세 가지 Agent Backbone과 여섯 개의 Benchmark에 걸쳐 모든 Baseline을 일관되게 능가하며, 가장 강력한 Baseline 대비 평균 점수를 각각 6.7점, 5.2점, 3.2점 향상시켰다. 예를 들어, Qwen3.5-9B와 EditAct의 조합은 Qwen3.5-35B-A3B와 ReAct의 성능을 뛰어넘어 (44.1 vs. 42.2), Agent Scale에 따른 성능 격차를 줄일 수 있음을 시사한다. 또한, AEWM이 가이드한 Trajectory를 사용한 Rejection Sampling Fine-tuning (RFT) 방식인 AEWM-RFT는 온라인 AEWM Guidance 없이도 Self-RFT 대비 세 가지 도메인에서 2.2–2.6점 더 높은 성능을 달성하여, 수정된 Trajectory가 Agent에게 Transferable한 Supervision을 제공함을 입증했다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Task-State Contamination 문제를 해결하고 LLM Agent의 신뢰성을 높이기 위한 통합 World Model인 AEWM을 성공적으로 제안했다. AEWM은 Action Judge를 통해 Decision Effect를 예측하고, State Revision을 통해 Agent State를 직접 Editing함으로써 기존 World Model의 한계를 극복한다. EditAct를 통한 Real Execution 통합은 Noisy한 Reasoning-Action Continuations을 효과적으로 대체하여 Agent의 Task Performance를 크게 향상시킨다. 이 연구는 Action Judgment의 정확도 향상과 함께 Search, Terminal, SWE 도메인 전반에 걸친 Agent Task Performance 개선을 정량적으로 입증했다. 또한, AEWM-RFT를 통해 AEWM의 가이드가 Agent에게 Transferable한 Decision Pattern을 제공할 수 있음을 보여주며, 이는 Long-Horizon Inference의 신뢰성 향상과 더불어 Transferable Agent Learning의 가능성을 제시한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
- [논문리뷰] Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models
- [논문리뷰] Scaling Agent Learning via Experience Synthesis
- [논문리뷰] Training Object Permanence in World Models
- [논문리뷰] The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Review 의 다른글
- 이전글 [논문리뷰] AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
- 현재글 : [논문리뷰] Agent-Editing World Model: Rethinking World Modeling for LLM Agents
- 다음글 [논문리뷰] AgentKernel: The Trust-Native Agentic Operating System
댓글