[논문리뷰] SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning본 논문은 강력한 long-context reasoning 능력을 갖춘 교사 모델로부터 단기 컨텍스트(short-context) 학생 모델로 추론 능력을 성공적으로 전수하는 것을 목표로 합니다.#Review#On-policy Distillation#Long-context Reasoning#Tokenizer-agnostic#ProofBench#Policy Alignment#KL Regularization2026년 8월 16일댓글 수 로딩 중