[논문리뷰] ROSS: Relearning from Self-Generated Rollouts through Selective Supervision본 논문은 LLM 학습 과정에서 발생하는 수많은 자가 생성 Rollouts가 정책(Policy)이 발전함에 따라 '낡은 것(stale)'으로 간주되어 버려지는 문제를 해결하고자 합니다.#Review#Large Language Models#Reinforcement Learning#On-policy Distillation#Selective Supervision#Trajectory Reuse#Offline SFT#Agentic RL2026년 9월 29일댓글 수 로딩 중