본문으로 건너뛰기

[논문리뷰] DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

링크: 논문 PDF로 바로 열기

저자: Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang, Haitao Mi, Zhenwen Liang, Tianqing Fang, Yi R. Fung

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • DeepSearch-World: 검색 및 페이지 읽기 도구를 포함한 결정론적(deterministic)이고 검증 가능한(verifiable) 오프라인 환경으로, Wikipedia 기반의 420K multi-hop QA 작업을 제공합니다.
  • DeepSearch-Evolve: 자기 자신의 검증된 경험으로부터 반복적으로 학습하여 에이전트 성능을 향상시키는 자기 증류(self-distillation) 프레임워크입니다.
  • Scaffold Process Supervision: 계획, 메모리 추적, 오류 복구 등 중간 과정에 대한 감독을 제공하는 교육 방식입니다.
  • ReAct: 언어 모델이 추론(Reasoning)과 행동(Acting)을 결합하여 복잡한 태스크를 수행하도록 하는 프레임워크입니다.
  • Evolving-SFT: 생성된 궤적을 검증하고, 이를 ReAct 형식의 지도 학습 데이터로 변환하여 에이전트를 점진적으로 업데이트하는 학습 루프입니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 기존의 도구 사용 에이전트들이 겪는 자기 개선의 한계인 정적인 모방 학습의 고착화와 강화 학습의 희소 보상 문제를 해결하고자 합니다. 기존 방식들은 고정된 교사 모델의 궤적에 의존하거나, 보상이 희소하여 복잡한 long-horizon 작업에서 성공적인 행동을 학습하는 데 어려움을 겪습니다. [Figure 1]에서 보여지듯, 기존 파이프라인은 인과 관계가 불분명한 보상이나 신뢰할 수 없는 감독 신호에 제한되어 있습니다. 따라서 저자들은 검증 가능한 환경 내에서 중간 단계의 도구 사용 결정을 프로세스 레벨에서 감독할 수 있는 안정적인 환경과 학습 체계를 제안합니다.

Figure 1: 기존 파이프라인과 제안하는 자기 증류 모델의 차이를 보여주는 핵심 개념도

Figure 1 — 기존 파이프라인과 제안하는 자기 증류 모델의 차이를 보여주는 핵심 개념도

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 검증 가능한 환경인 DeepSearch-World를 구축하고, 이를 기반으로 DeepSearch-Evolve라는 자기 증류 루프를 통해 에이전트를 학습시킵니다. 에이전트는 PLAN, ACT, END의 3단계 스캐폴드 교사 에이전트를 통해 궤적을 생성하며, 이 과정에서 환경은 entity-level의 객관적인 검증을 수행합니다. 검증된 성공적 궤적은 다시 ReAct 형식으로 변환되어 학생 모델의 지도 학습(SFT) 데이터로 활용됩니다. 이러한 아키텍처는 [Figure 2]에 상세히 정의되어 있습니다. DeepSearch-World-9B 모델은 실험에서 BrowseComp 31.2%, GAIA 61.5%, HotpotQA 93.4%의 성능을 달성하며 오픈 소스 에이전트로서 매우 강력한 경쟁력을 증명했습니다. [Table 1]에서 볼 수 있듯이, 동일한 9B 모델 규모의 backbone인 Qwen3.5-9B-Instruct와 비교했을 때, 모든 벤치마크에서 큰 폭의 성능 향상을 보였으며 특히 HotpotQA에서 +48.1%의 비약적인 개선을 기록했습니다.

Figure 2: 전체 프레임워크의 구조와 에이전트의 학습 루프를 설명하는 핵심 다이어그램

Figure 2 — 전체 프레임워크의 구조와 에이전트의 학습 루프를 설명하는 핵심 다이어그램

Table 1: 제안 모델의 성능 우위를 정량적으로 보여주는 핵심 벤치마크 비교표

Table 1 — 제안 모델의 성능 우위를 정량적으로 보여주는 핵심 벤치마크 비교표

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 결정론적인 환경에서의 자기 증류가 복잡한 long-horizon 검색 에이전트의 스케일 가능한 학습을 위한 핵심 경로임을 입증했습니다. 이 연구는 더 이상 강력한 proprietary 모델의 합성 데이터에 의존하지 않고도, 에이전트 스스로의 검증된 경험을 통해 성능을 극대화할 수 있음을 보여주었습니다. 이는 향후 대규모 에이전트 모델의 자율적 개선과 도구 사용 능력 향상을 위한 중요한 학술적·기술적 토대가 될 것으로 기대됩니다.


⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글