[논문리뷰] Rethinking On-Policy Distillation of Large Language Models II: One Training Example본 논문은 LLM의 후처리(post-training) 과정에서 널리 활용되는 On-policy Distillation (OPD) 방법론에서 훈련 데이터(training data)의 역할이 불분명하다는 핵심 문제를 제기합니다.#Review#On-policy Distillation (OPD)#Large Language Models (LLMs)#State Coverage#Absorption Rate#Data Efficiency#One-shot Learning#Multi-teacher OPD (MOPD)2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning본 논문은 LLM이 추론 과정에서 다양한 가설을 생성, 검증, 개선하는 'In-Context Exploration' 능력을 효과적으로 발휘하지 못하는 문제를 해결하고자 합니다.#Review#Large Language Models#In-Context Learning#Reinforcement Learning#Test-Time Scaling#Exploration-Exploitation#State Coverage#Reward Shaping#Chain-of-Thought2026년 2월 12일댓글 수 로딩 중