[논문리뷰] H^2SD: Hybrid Hindsight Self-Distillation본 논문은 기존의 RLVR 방식이 가지는 희소한 Supervision(Sparse supervision) 문제와 OPSD 및 RLSD 사이의 성능-안정성 트레이드오프 문제를 해결하고자 한다 .#Review#Reinforcement Learning#Self-Distillation#LLM Reasoning#Credit Assignment#Hybrid Hindsight#Privileged Information2026년 7월 21일댓글 수 로딩 중