[논문리뷰] DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment본 논문은 기존의 도구 사용 에이전트들이 겪는 자기 개선의 한계인 정적인 모방 학습의 고착화와 강화 학습의 희소 보상 문제를 해결하고자 합니다. 기존 방식들은 고정된 교사 모델의 궤적에 의존하거나, 보상이 희소하여 복잡한 long-horizon 작업에서 성공적인 행동을 학습하는 데 어려움을 겪습니다.#Review#Self-Distillation#Deep Search Agents#Verifiable Environment#Scaffold Process Supervision#ReAct#Self-Evolving2026년 7월 20일댓글 수 로딩 중