[논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement본 논문은 On-Policy Distillation (OPD)의 Teacher Supervision 신호가 off-policy context에서 본질적으로 noisy하며, 이러한 노이즈가 학생 모델의 성능 향상에 미치는 영향이 불분명하다는 문제를 제기한다.#Review#On-Policy Distillation#Self-Adaptation#Reinforcement Learning#LLM#Token-level Supervision#Entropy-adaptive Advantages#Mathematical Reasoning2026년 8월 31일댓글 수 로딩 중
[논문리뷰] REVERE: Reflective Evolving Research Engineer for Scientific Workflows기존의 Prompt-Optimization Techniques는 주로 Local Signals에 의존하여 Behavior를 업데이트하며, 이로 인해 Generalization이 저하되고 Full-Prompt Rewrites나 Unstructured Merges 과정에서 Knowledge Loss가 발생합니다.#Review#LLM Agents#Self-Adaptation#Research-Coding Workflows#Prompt Optimization#Global Training Context#Code-Based Edits#Continual Learning#Semantic Drift2026년 3월 23일댓글 수 로딩 중