[논문리뷰] PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning본 논문은 LLM agent의 다회차 상호작용 환경에서 발생하는 보상 희소성(reward sparsity)과 teacher guidance의 신뢰성 저하 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#On-Policy Self-Distillation#Teacher Reliability#Persistent Consistency#Adaptive Aggregation#Token-level Weighting#Multi-turn Interaction2026년 8월 4일댓글 수 로딩 중