[논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization본 논문은 기존 RLVR 방식의 핵심 한계인 Entropy의 '정확성 인식 능력 부재' 문제를 해결합니다. 기존의 Entropy 기반 방식들은 모델의 불확실성을 측정하지만, 이것이 생산적인 탐색인지 아니면 단순한 오류인지 구분하지 못해 최적화의 모호함을 야기합니다 .#Review#Reinforcement Learning#Advantage Shaping#Contrastive Policy Optimization#RLVR#LLM Reasoning#Token-level Supervision2026년 7월 19일댓글 수 로딩 중
[논문리뷰] ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation본 논문은 구조적 프루닝(Structured Pruning)이 적용된 LLM이 객관식 벤치마크에서는 성능을 유지하지만, 실제 배포 시 요구되는 자유 형식 생성(Free-form generation)에서는 심각하게 붕괴하는 현상을 해결하고자 합니다.#Review#Structured Pruning#On-Policy Distillation#LLM Compression#Model Recovery#Repetition Control#Token-level Supervision2026년 7월 15일댓글 수 로딩 중