[논문리뷰] Environment-free Synthetic Data Generation for API-Calling Agents
링크: 논문 PDF로 바로 열기
저자: Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander Toshev, Oncel Tuzel, Raviteja Vemulapalli
1. Key Terms & Definitions (핵심 용어 및 정의)
- ESAT: Environment-free Synthetic Agentic Trajectory generation의 약자로, 실행 가능한 환경 없이 API 사양(specifications)만으로 에이전트 학습용 데이터를 생성하는 파이프라인입니다.
- LLM Simulator: 실시간으로 API 실행 결과와 환경 피드백을 생성하는 핵심 모듈로, 문맥(context)과 상태(state)를 유지하며 Digital World Model 역할을 수행합니다.
- TGC (Task Goal Completion): 에이전트가 주어진 작업을 성공적으로 완수했는지 측정하는 지표입니다.
- SGC (Scenario Goal Completion): 전체 시나리오 단계에서의 목표 달성도를 평가하는 지표입니다.
- Bucketized generation: 작업 공간의 균형 잡힌 커버리지를 위해 difficulty, action type, task focus 등의 속성에 따라 데이터를 조합하는 생성 방식입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 API-calling 에이전트를 위한 대규모 고품질 학습 데이터 수집의 병목 현상을 해결하고자 합니다. 기존 방식은 실행 가능한 환경과 구축된 백엔드 데이터베이스에 의존해야 하므로, 새로운 API 도메인으로 확장하는 데 막대한 인프라 비용과 시간이 소요됩니다. 저자들은 이러한 물리적 환경 의존성을 배제하기 위해, LLM의 방대한 세계 지식을 활용하여 API 사양만을 바탕으로 가상의 환경 피드백을 동적으로 생성하는 환경 독립적 데이터 생성 패러다임을 제안합니다. [Figure 1]에 제시된 ESAT 파이프라인은 인프라 구축의 어려움 없이 다양한 API 생태계로 확장할 수 있는 실용적이고 확장 가능한 해결책을 제공합니다.

Figure 1 — ESAT 데이터 생성 파이프라인의 3단계 구조를 직관적으로 설명하는 핵심 다이어그램
3. Method & Key Results (제안 방법론 및 핵심 결과)
ESAT은 Task Synthesis, Trajectory Synthesis, Trajectory Filtering의 3단계로 구성되어 고품질의 에이전트 데이터를 자동 생성합니다. 우선 Task generator LLM이 API 사양을 기반으로 다양한 작업을 생성하고, 교사 에이전트(teacher agent)가 이를 해결하는 동안 LLM 기반 API simulator가 시뮬레이션 기록을 바탕으로 일관된 응답을 제공합니다. 마지막으로 Trajectory judge LLM이 생성된 궤적의 품질을 검증하여 필터링합니다. 실험 결과, Qwen3 및 Qwen3.5 모델(1.7B~27B 파라미터)을 ESAT 데이터로 SFT(Supervised Fine-Tuning)한 결과, AppWorld에서 최대 50.5%, OfficeBench에서 60.5%의 성능 향상을 기록했습니다. 특히 AppWorld에서는 실환경 데이터로 학습한 모델보다 더 뛰어난 성능을 보였으며, [Table 1]에서 확인할 수 있듯이 새로운 API로의 강력한 일반화 능력을 입증했습니다.

Table 1 — 다양한 모델 규모에서의 성능 향상을 보여주는 핵심 실험 결과 테이블
4. Conclusion & Impact (결론 및 시사점)
본 연구는 고품질 API-calling 데이터 생성이 실제 실행 환경 없이도 LLM의 시뮬레이션 능력만으로 가능하다는 것을 성공적으로 증명했습니다. ESAT을 통해 구축된 데이터는 대규모 인프라 구축의 제약을 제거하여 에이전트 학습의 범용성과 확장성을 극대화합니다. 이러한 접근법은 향후 더욱 복잡하고 다양한 도메인의 API 에이전트를 개발하고 지식을 전이(Knowledge Transfer)하는 데 중요한 이정표가 될 것이며, 실질적인 에이전트 학습 비용 절감에 크게 기여할 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
- [논문리뷰] Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- [논문리뷰] SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- [논문리뷰] G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection
- [논문리뷰] SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Review 의 다른글
- 이전글 [논문리뷰] Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
- 현재글 : [논문리뷰] Environment-free Synthetic Data Generation for API-Calling Agents
- 다음글 [논문리뷰] EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
댓글