[논문리뷰] Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy DistillationLarge Language Models (LLMs)의 post-training 과정에서 reinforcement learning (RL)을 통해 수학, 코딩, instruction following (IF)과 같은 특정 기술에 특화된 specialists를 생성할 수 있지만, 사용자들은 이 모든 기술을 통합한 단일 모델을 필요로 한다.#Review#Reinforcement Learning#Multi-Teacher Distillation#On-Policy Distillation#Domain Normalization#Language Models#Capability Integration#Feedback Scaling#Log-Ratio Spread2026년 9월 28일댓글 수 로딩 중