[논문리뷰] CAFE: Self-Improving Search Agents Need Co-Evolving Feedback본 논문은 장기 탐색(long-horizon search) 과정에서 발생하는 중간 단계의 오류를 효과적으로 교정하고, 탐색 에이전트와 이를 가이드하는 피드백 모델이 상호 진화(co-evolve)해야 한다는 점에 주목합니다.#Review#Search Agents#Co-Evolving Feedback#Reinforcement Learning#Credit Assignment#Preference Optimization#LLM2026년 8월 25일댓글 수 로딩 중