본문으로 건너뛰기

#Token-level Supervision

3개의 포스트

[논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

댓글 수 로딩 중

[논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

댓글 수 로딩 중

[논문리뷰] ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

댓글 수 로딩 중