[논문리뷰] RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning본 논문은 Agentic task에서 사용되는 기존의 On-Policy Distillation (OPD) 방식이 가지는 고질적인 한계들을 해결하고자 합니다 .#Review#Agentic Reinforcement Learning#On-Policy Distillation#Privileged Information#Adaptive Retirement#LLM Agents#GRPO2026년 9월 17일댓글 수 로딩 중