[논문리뷰] AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale
링크: 논문 PDF로 바로 열기
메타데이터
저자: Minbyul Jeong, Chanwoong Yoon, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Planet: 고수준의 비즈니스 시나리오를 바탕으로 엔티티, 서비스, 툴, 상태, 전이 로직 및 World-level invariants를 포함하는 실행 가능한 환경(Executable World)을 생성하는 역할을 수행하는 프레임워크 내 핵심 모듈입니다.
- World-level Invariants: 환경 내에서 유지되어야 하는 조건들을 정의하며, Deterministic Grading을 위해 실행 가능한 검증 조건으로 활용되는 속성입니다.
- Executable Environment: 에이전트가 직접 상호작용할 수 있는 실체적인 환경으로, 고정된 태스크가 아닌 시나리오로부터 도출된 상태와 서비스 상호작용을 포함하는 환경입니다.
- GRPO (Group Relative Policy Optimization): 에이전트의 정책을 학습시키기 위해 사용된 강화학습 알고리즘으로, 본 논문에서 생성된 환경 내에서 최적화를 수행하는 데 사용되었습니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 에이전트 연구가 태스크 중심으로 환경을 구성함에 따라, 현실적인 워크플로우를 반영한 다양한 환경으로 확장이 어렵다는 근본적인 문제를 해결하고자 합니다 [Figure 1]. 현재의 방식은 환경이 특정 벤치마크나 태스크를 위해 사전에 정의된 'artifact'로 존재하며, 에이전트가 학습 과정에서 세계를 직접 구성하는 능력을 고려하지 않습니다. 이러한 태스크 중심적 패러다임은 다양한 비즈니스 상황에서의 복잡한 상호작용과 상태 변화를 충분히 담아내지 못하는 한계를 지닙니다. 따라서 저자들은 고수준의 비즈니스 시나리오를 입력받아 실행 가능한 환경을 자동 생성하는 AgentMercury를 제안합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 Planet 프레임워크를 통해 비즈니스 시나리오를 구조화된 세계로 변환하고, 이를 통해 다양한 태스크가 자연스럽게 파생될 수 있도록 하는 환경 합성 방법론을 제시합니다 [Figure 2]. 이 시스템은 비즈니스 서비스 그래프, 상태 스키마, 그리고 Deterministic Grading을 위한 검증 로직을 분리하여 환경의 일관성을 유지합니다. 실험 결과, AgentMercury 환경에서 사전 학습된 Qwen3.5-4B 모델은 EnterpriseOps-GYM 벤치마크에서 기존 12.3점 대비 향상된 15.7점을 기록하며 성능 우위를 입증했습니다. 또한, 고난도 수학 벤치마크인 AIME26에서도 45.9점에서 56.0점으로 크게 향상되었습니다. 마지막으로, 건설 트레이스(construction traces)를 활용하여 환경 생성 자체를 학습시킨 결과, 모델의 세계 작가 성공률이 3.3%에서 83.3%로 대폭 상승하며 환경 생성이 학습 가능한 능력임을 증명했습니다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 태스크 중심의 환경 구성을 넘어, 시나리오에 기반한 실행 가능한 세계를 생성하는 새로운 패러다임을 확립했습니다. AgentMercury를 통해 생성된 다양한 비즈니스 환경은 에이전트의 일반화 성능을 크게 향상시키며, 환경 구성 그 자체가 에이전트 학습의 중요한 구성 요소임을 시사합니다. 이러한 접근 방식은 향후 산업계의 복잡한 실무 환경을 에이전트 학습 시스템에 통합하는 데 중요한 기반이 될 것입니다. 저자들은 환경 생성 코드와 모델을 공개하여 관련 분야의 연구 가속화를 지원합니다.
Part 2: 중요 Figure 정보

Figure 1 — AgentMercury 환경의 규모와 다양성

Figure 2 — Planet 프레임워크 및 에이전트 상호작용 루프
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
- [논문리뷰] Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
- [논문리뷰] ClawGym II: Exploring Black-Box RL on Agent Harness
- [논문리뷰] Enhancing Rubric-based RL via Self-Distillation
- [논문리뷰] MemHarness: Memory Is Reconstructed, Not Replayed
Review 의 다른글
- 이전글 [논문리뷰] WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- 현재글 : [논문리뷰] AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale
- 다음글 [논문리뷰] Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
댓글