[논문리뷰] Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization본 논문은 다중 Reward Objective를 최적화할 때 발생하는 Reward-resolution loss와 불균형한 최적화 우선순위 문제를 해결하고자 합니다.#Review#Reinforcement Learning#Multi-Reward Optimization#Policy Optimization#Language Model Alignment#Saturation Aware Reweighting#Group Relative Policy Optimization2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Trust-Region Behavior Blending for On-Policy Distillation본 논문은 OPD 초기 단계에서 발생하는 학습 불안정성과 낮은 품질의 데이터 생성 문제를 해결하고자 합니다. 기존 OPD는 학생 모델이 학습 초기에 낮은 품질의 trajectory를 생성하면, 교사 모델의 지도(supervision)가 비효율적인 영역에 집중되는 한계가 있습니다 .#Review#On-policy Distillation#Trust Region#Knowledge Distillation#Language Model Alignment#Annealed Warmup#Behavior Policy2026년 5월 31일댓글 수 로딩 중