[논문리뷰] ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
링크: 논문 PDF로 바로 열기
메타데이터
저자: Zhiwei Zhang, Huayu Deng, Fei Zhao, Jiayan Fu, Bin Liang, Kam-Fai Wong, Mu Chuan
1. Key Terms & Definitions (핵심 용어 및 정의)
- ROSS (Relearning from Self-Generated Rollouts through Selective Supervision): 학습 과정에서 생성된 과거의
Rollouts를 재사용하여, 모델이 발견한 유용한 행동을 선택적으로 통합하는 학습 프레임워크입니다. - On-policy Distillation (OPD): 학생 모델이 교사 모델로부터 생성된 궤적을 기반으로 학습하여 성능을 개선하는 방법론입니다.
- Trajectory-level Selection: 전체
Rollouts중Task outcome이 성공적인 사례만을 필터링하는 단계입니다. - Token-level Supervision Mask: 성공한
Rollouts내부에서도 유익한 부분과 중복되거나 잘못된 부분을 구분하여, 모델이 필요한 행동만을 학습하도록 하는 세밀한 마스킹 기법입니다. - Agentic RL: 긴 호흡의 상호작용이 필요한 에이전트 환경에서 수행되는 강화학습으로,
ROSS는 이를 통한 복잡한 궤적의 재학습에도 적용됩니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM 학습 과정에서 발생하는 수많은 자가 생성 Rollouts가 정책(Policy)이 발전함에 따라 "낡은 것(stale)"으로 간주되어 버려지는 문제를 해결하고자 합니다. 기존 방식은 성공적인 Rollouts를 통째로 모방 학습(Imitation Learning)하지만, 이러한 궤적에는 정답 외에도 중복된 추론, 불필요한 경로, 혹은 중간 단계의 실수 등이 포함되어 있어 오히려 성능 향상을 저해할 수 있습니다 [Figure 1]. 따라서 저자들은 단순히 성공한 궤적을 재현하는 것을 넘어, 어떤 부분을 학습하고 어떤 부분을 무시할지 결정하는 세밀한 선택적 감독(Selective Supervision)의 필요성을 제기합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들이 제안하는 ROSS는 Verifier를 통해 성공적인 궤적을 먼저 필터링하고, LLM 기반 검토자를 통해 유효한 추론 구간을 식별하여 해당 구간에만 Loss를 적용하는 Masked SFT 방식을 취합니다 [Figure 4]. 이 과정에서 전체 궤적은 문맥(Context)으로 유지되지만, 학습 대상은 선택된 토큰으로 제한됩니다. 실험 결과, Qwen3.6-35B-A3B 모델에 적용했을 때 MOPD(Multi-teacher On-policy Distillation) 6개 벤치마크 평균 성능이 58.40%에서 62.20%로 향상되었습니다. 또한, 에이전트 학습 환경인 SWE-bench Verified에서도 68.40%의 성과를 기록하며 기존 Upstream 체크포인트 대비 유의미한 성능 향상을 보였습니다 [Table 1, Table 2]. 특히, 토큰 수준의 마스킹이 없는 단순 모방 학습보다 훨씬 높은 효율성을 입증하며, 재학습 과정이 기존 정책의 초기화 상태와 무관하게 일반화 가능한 행동 지식을 통합할 수 있음을 보여주었습니다 [Table 4].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 과거의 학습 경험이 단순히 버려지는 데이터가 아니라, 선택적 감독을 통해 재통합될 수 있는 가치 있는 자산임을 입증했습니다. ROSS는 도메인 특화 RL, MOPD, 에이전트 학습 등 다양한 환경에서 별도의 정책 Rollouts 생성 없이도 모델의 성능을 추가로 극대화할 수 있는 강력한 오프라인 학습 단계를 제공합니다. 이는 모델 학습의 효율성을 크게 높일 뿐만 아니라, 학계 및 산업계에서 대규모 모델의 성능 고도화를 위한 새로운 학습 패러다임을 제시합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs
- [논문리뷰] EasyPPO: Stabilizing the Critic Is Key
- [논문리뷰] Nereus: Adaptive Parallelism for LLM Post-Training
- [논문리뷰] An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning
- [논문리뷰] VideoGen-Agent: Reinforcing Video Generation Agents
Review 의 다른글
- 이전글 [논문리뷰] Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
- 현재글 : [논문리뷰] ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
- 다음글 [논문리뷰] Raven: The Harness of Harnesses for Composable Agentic Intelligence
댓글