[논문리뷰] EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu
1. Key Terms & Definitions (핵심 용어 및 정의)
- World Rehearsal: 외부 환경을 직접 쿼리하는 대신, 정책 모델이 스스로 환경의 역할을 수행하며 행동에 따른 응답을 생성하는 학습 및 추론 기법입니다.
- EnvACE: 에이전트 정책이 acting과 rehearsal 두 가지 역할을 수행하며, task-success reward를 통해 이를 end-to-end로 최적화하는 에이전트 강화학습 프레임워크입니다.
- Role-Wise GRPO: acting과 rehearsal이라는 각기 다른 역할에 대해 별도의 보상 baseline을 설정하여 효율적인 advantage를 산출하고 최적화하는 기법입니다.
- Test-Time Scaling: 학습된 모델이 실제 환경에서 행동하기 전, 스스로 다양한 시나리오를 rehearsal하여 더 나은 의사결정을 내리도록 추론 시간을 최적화하는 전략입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM 에이전트 학습 시 외부 환경과의 상호작용에 의존해야 하는 높은 비용과 검증의 어려움을 해결하는 것을 목표로 합니다. 기존 연구들은 외부 환경이나 별도의 시뮬레이터를 통해 학습 데이터를 생성하지만, 이는 환경 역학(dynamics)을 모델 외부에 두어 에이전트의 일반적인 의사결정 역량을 제한한다는 한계가 있습니다. 따라서 본 연구는 에이전트 스스로 환경 역학을 내부화하여 모델의 매개변수 안에 담아내는 새로운 학습 패러다임이 필요하다고 주장합니다 [Figure 1].

Figure 1 — 에이전트 롤아웃 패러다임 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 에이전트 정책이 acting과 rehearsal이라는 두 가지 역할을 동시에 수행하며, 이 과정을 self-unfolded trajectories를 통해 end-to-end로 최적화하는 EnvACE를 제안합니다 [Figure 2]. 각 턴에서 모델은 도구 호출(action)을 생성한 후, 해당 호출이 유발할 환경 응답(response)을 스스로 생성(rehearse)하며, 이를 바탕으로 다음 행동을 결정합니다. Role-Wise GRPO를 도입하여 두 역할의 보상 baseline을 분리함으로써 최적화의 안정성을 확보했습니다. 실험 결과, EnvACE-8B는 BFCL-v4, τ²-Bench, VitaBench 등 다수의 벤치마크에서 기존의 환경 확장(environment-scaling) 기반 baselines를 뛰어넘는 성능을 보였습니다. 특히 FinMCP-Bench에서 TF1 46.78%를 기록하며 최적의 precision-recall 균형을 달성했습니다 [Table 2]. 또한 Test-Time Scaling을 통해 추가적인 외부 상호작용 없이도 성능 향상을 달성하였으며, 병렬 rehearsal 모드에서 Overall 성능이 36.7%에서 40.9%로 개선되는 성과를 보였습니다 [Table 3].

Figure 2 — EnvACE 및 월드 리허설 개요
4. Conclusion & Impact (결론 및 시사점)
본 논문은 에이전트가 환경 역학을 내부화하는 'world rehearsal' 기법을 도입함으로써, 외부 환경에 대한 의존성을 획기적으로 낮추는 에이전트 학습의 새로운 경로를 제시합니다. 제안된 EnvACE는 행동과 환경 모델링을 통합하여 더 일반화 가능한 에이전트 성능을 구현하였으며, 추론 시점의 스케일링을 통해 에이전트의 자율적 의사결정 능력을 극대화했습니다. 이 연구는 학계의 에이전트 훈련 효율성을 높이고, 산업계에서 실환경 제약이 큰 도구 사용 에이전트 구축에 중요한 기여를 할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — 에이전트 롤아웃 패러다임 비교

Figure 2 — EnvACE 및 월드 리허설 개요

Figure 4 — 모델 스케일별 성능 비교

Figure 4 — 모델 스케일별 성능 비교
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
- [논문리뷰] The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
- [논문리뷰] SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
- [논문리뷰] SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- [논문리뷰] AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
Review 의 다른글
- 이전글 [논문리뷰] EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal
- 현재글 : [논문리뷰] EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
- 다음글 [논문리뷰] From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
댓글