[논문리뷰] An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning본 논문은 기존 OPD 방식이 갖는 낮은 샘플 효율성과 탐색 제한 문제를 해결하는 것을 목표로 합니다. 기존의 PPO 기반 OPD 구현은 매번 새로운 롤아웃(rollout)을 생성해야 하는 온-정책(on-policy) 특성으로 인해 학습 시간이 길고 데이터 재사용이 불가능하다는 한계가 있습니다.#Review#Large Language Models#On-Policy Distillation#Reinforcement Learning#Least-Square Policy Distillation#Off-policy Learning#KL-regularization#Sample Efficiency2026년 9월 28일댓글 수 로딩 중