[논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning본 논문은 LLM의 수학적 추론 능력을 향상시키기 위한 On-Policy Distillation 기법을 다국어(한국어, 일본어 등) 환경으로 확장하는 것을 목표로 합니다. 기존 연구들은 주로 영어 중심의 추론 벤치마크에 집중되어 있어, 비영어권 언어에서의 OPD 및 OPD^2^ 성능 검증이 미흡한 실정입니다.#Review#On-Policy Distillation#OPD^2^#Multilingual Math Reasoning#LLM Post-training#Reasoning Transfer#English-Korean Performance Gap2026년 8월 6일댓글 수 로딩 중