[논문리뷰] DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment본 논문은 기존의 도구 사용 에이전트들이 겪는 자기 개선의 한계인 정적인 모방 학습의 고착화와 강화 학습의 희소 보상 문제를 해결하고자 합니다. 기존 방식들은 고정된 교사 모델의 궤적에 의존하거나, 보상이 희소하여 복잡한 long-horizon 작업에서 성공적인 행동을 학습하는 데 어려움을 겪습니다.#Review#Self-Distillation#Deep Search Agents#Verifiable Environment#Scaffold Process Supervision#ReAct#Self-Evolving2026년 7월 20일댓글 수 로딩 중
[논문리뷰] FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents본 연구는 Deep Search Agents가 훈련 과정에서 데이터셋 내의 의도치 않은 패턴인 Shortcut에 과도하게 의존하여 실제 검색 환경에서 성능이 저하되는 현상을 해결합니다.#Review#Deep Search Agents#Shortcut-Resistant#Task Synthesis#Representation Learning#Reinforcement Learning#Information Retrieval#Robustness2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window본 논문은 기존의 다중 턴 에이전트가 낮은 태스크 복잡도와 컨텍스트 관리의 한계로 인해 장기적인 상호작용에서 깊은 추론 능력을 발휘하지 못하는 문제를 해결하고자 합니다.#Review#Deep Search Agents#Dynamic Context Window#Reinforcement Learning#Long-horizon Interaction#Context Management#High-difficulty Tasks#Multi-turn Reasoning#Web Agents2025년 10월 10일댓글 수 로딩 중