본문으로 건너뛰기

#Supervised Fine-Tuning

28개의 포스트

[논문리뷰] On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

댓글 수 로딩 중