본문으로 건너뛰기

[논문리뷰] Environment Evolution for Terminal Agents

링크: 논문 PDF로 바로 열기

메타데이터

저자: Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, et al.


## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Terminal Agents: 명령줄 도구를 사용하여 컴퓨팅 환경과 상호작용하며 장기적인 작업을 수행하는 에이전트.
  • Environment Evolution: 에이전트의 학습 신호를 지속적으로 제공하기 위해, 환경을 세대별로 점진적으로 어렵게 진화시키는 오프라인(off-policy) 패러다임.
  • EL (Evolution-Lineage) Scheduler: 진화된 환경 시퀀스를 모델의 학습 수준에 맞춰 적절히 배치하여 학습 신호의 질을 최적화하는 스케줄러.
  • Evolution Effort: 환경 진화의 강도를 제어하는 파라미터로, Low/High/Max 수준에 따라 편집 범위를 제한함.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 고성능 터미널 에이전트 학습을 위한 환경의 난이도 부족 문제를 해결하는 것을 목표로 한다. 최근 구축된 대규모 터미널 환경들은 모델의 성능이 향상됨에 따라 더 이상 충분한 학습 신호를 제공하지 못하며, 이로 인해 RL 과정에서 성능 개선을 위한 차별화된 학습 신호가 결여되는 한계가 있다. 기존의 Co-evolution 방식은 에이전트의 온폴리시(on-policy) 롤아웃에 의존하여 모델 특정적인 취약점에 편향되므로, 일반화된 환경 진화 패러다임이 요구된다 [Figure 1].

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 논문은 다중 턴 학습 목표로부터 모델 독립적인 오프라인 환경 난이도 공식을 유도하고, 이를 기반으로 시나리오, 기술, 길이의 세 가지 진화 방향을 제안한다. 제안된 진화 프레임워크는 루프 엔진 기반의 멀티 에이전트 하네스를 통해 환경을 점진적으로 복잡하게 수정하며, 각 세대별로 검증된 환경 계보를 구축한다 [Figure 2]. EL Scheduler는 모델의 학습 진척도에 따라 난이도가 조정된 환경을 순차적으로 공급하여 효율적인 학습 신호를 보장한다. 실험 결과, 본 방법론을 적용한 Qwen3.6-27BQwen3.6-35B-A3B 모델은 Terminal-Bench 2.1에서 각각 14.4%p, 18.0%p의 성능 향상을 기록하였다 [Figure 7]. 특히, 기존 Co-evolution 대비 더 오래 지속되는 학습 신호를 제공하며 더 높은 정량적 성능 우위를 입증하였다 [Table 1].

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 오프라인 환경 진화가 터미널 에이전트의 장기 학습을 위한 보다 일반적이고 강력한 환경 확장 패러다임임을 입증하였다. 진화된 환경은 모델의 학습 효율성을 극대화하며, 세대별 난이도 상승을 통해 모델의 성능을 한계치까지 견인할 수 있다. 이 연구는 향후 SWE 에이전트나 Computer-Use 에이전트와 같은 복잡한 에이전트 시스템을 위한 자동화된 환경 구축 및 교육 파이프라인 개발에 중요한 이정표를 제시한다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글