[논문리뷰] Enhancing Rubric-based RL via Self-Distillation본 논문은 Rubric-based RL에서 발생하는 exploration의 한계와 scalar reward 집계로 인한 학습 신호 소실 문제를 해결하고자 합니다. 기존의 GRPO 기반 연구들은 특정 기준을 만족하는 사례가 없으면 학습 신호를 생성하지 못하는 Unexplored Criteria 문제에 직면해 있습니다.#Review#Reinforcement Learning#Rubric-based RL#Self-Distillation#LLM#Policy Optimization#GRPO#Alignment2026년 8월 2일댓글 수 로딩 중