[논문리뷰] Trust Region Policy Distillation본 논문은 기존 On-Policy Distillation (OPD) 방식이 가진 구조적 불안정성과 낮은 샘플 효율성 문제를 해결하기 위해 고안되었습니다.#Review#On-Policy Distillation#Trust Region#Policy Gradient#Proximal Teacher#Gradient Variance#Mathematical Reasoning#Post-training2026년 7월 12일댓글 수 로딩 중