[논문리뷰] Distilled Reinforcement Learning for LLM Post-training본 논문은 기존 RL과 OPD가 가진 한계를 해결하기 위해 Distilled RL을 제안합니다. RL은 결과 중심의 coarse-grained 보상을 사용하여 credit assignment 문제를 겪으며 새로운 지식 습득에 한계가 있습니다.#Review#LLM Post-training#Reinforcement Learning#Knowledge Distillation#On-Policy Distillation#Credit Assignment#Policy Gradient#Cross-family Distillation2026년 7월 20일댓글 수 로딩 중