[논문리뷰] SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning본 논문은 장기적(Long-horizon) agentic 작업에서 발생하는 sparse trajectory-level reward와 token-level policy learning 사이의 불일치 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#On-Policy Distillation#Hindsight Learning#Large Language Models#Supervised Fine-Tuning#Self-Evolving2026년 7월 16일댓글 수 로딩 중