[논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning
링크: 논문 PDF로 바로 열기
저자: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
## 1. Key Terms & Definitions (핵심 용어 및 정의)
- OPD (On-Policy Distillation): 강화학습(RL)을 대체하기 위해 제안된 기법으로, 학생 모델이 생성한 trajectory에 대해 교사 모델이 제공하는 토큰 단위의 확률 분포를 학습하여 성능을 개선하는 방식입니다.
- OPD^2^ (On-Policy Delta Distillation): 교사 모델과 그 모델의 base model 간의 확률 차이(Delta)를 학습 신호로 사용하는 향상된 distillation 기법으로, post-training 과정에서 획득된 추론 능력을 효과적으로 추출합니다.
- Thinking/Non-thinking Mode: LLM이 답변 생성 전 연산(chain-of-thought)을 수행하는 모드와 즉각적으로 답변을 생성하는 모드를 구분하여 모델의 추론 특성을 분석합니다.
- Target-language Response Rate: 입력 질문의 언어와 모델이 실제로 응답한 언어의 일치 비율을 측정하는 지표로, reasoning 능력의 전이와 언어적 선호도 보존 여부를 평가합니다.
## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 논문은 LLM의 수학적 추론 능력을 향상시키기 위한 On-Policy Distillation 기법을 다국어(한국어, 일본어 등) 환경으로 확장하는 것을 목표로 합니다. 기존 연구들은 주로 영어 중심의 추론 벤치마크에 집중되어 있어, 비영어권 언어에서의 OPD 및 OPD^2^ 성능 검증이 미흡한 실정입니다. 또한, 영어 전용 데이터로 학습된 모델이 타 언어의 벤치마크 점수를 향상시킬 수 있는지, 그리고 이것이 실제 타겟 언어 구사 능력의 향상인지 아니면 단순한 영어 기반 추론의 전이인지에 대한 규명이 필요합니다 [Figure 1].

Figure 1 — OPD와 OPD^2^ 성능 비교
## 3. Method & Key Results (제안 방법론 및 핵심 결과) 저자들은 Qwen3-1.7B 및 Qwen3-8B 모델을 학생 모델로, Qwen3-30B-A3B-2507을 교사 모델로 활용하여 **OPD^2^**의 다국어 수학 추론 성능을 검증합니다. **OPD^2^**는 교사 모델과 그 base model 사이의 로그 확률 차이를 보상으로 정의하여 학습하며, 이는 모델이 post-training을 통해 습득한 추론 능력을 보다 정교하게 추출합니다 [Figure 1]. 실험 결과, **OPD^2^**는 모든 언어 환경에서 기존 OPD를 능가하는 성능을 보였으며, 특히 한국어와 일본어에서 뚜렷한 향상을 나타냈습니다. 또한, **OPD^2^**는 다국어 환경에서 영어와 한국어 간의 추론 성능 격차를 효과적으로 축소하는 경향을 확인하였습니다 [Figure 2]. 흥미롭게도, 영어 전용(English-only) 데이터로 학습된 모델도 다국어 벤치마크에서 우수한 정확도를 기록할 수 있으나, 정성적 분석 결과 응답 언어의 영어 편향이 심화되는 현상을 보였습니다 [Table 1], [Figure 3]. 이는 Reasoning 능력의 전이와 언어적 정체성 보존이 별개의 문제임을 시사합니다.

Figure 2 — 영어-한국어 성능 격차

Figure 3 — 영어 전용 vs 다국어 학습 비교
## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 **OPD^2^**가 영어뿐만 아니라 다국어 환경에서도 효율적인 post-training 프레임워크임을 입증하였습니다. 특히, 단순한 벤치마크 점수 향상뿐만 아니라 실제 출력 언어의 일치도를 평가함으로써 언어 모델의 추론 능력 전이와 언어적 표현의 상관관계를 명확히 구분하였습니다. 이 결과는 향후 다국어 LLM 개발 시, 정량적 성능 지표와 함께 언어적 적응성을 함께 고려해야 할 필요성을 강조하며, 효과적인 다국어 추론 학습을 위한 방법론적 기초를 제공합니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Distilled Reinforcement Learning for LLM Post-training
- [논문리뷰] On-Policy Delta Distillation
- [논문리뷰] Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- [논문리뷰] Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
- [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
Review 의 다른글
- 이전글 [논문리뷰] OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
- 현재글 : [논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning
- 다음글 [논문리뷰] PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
댓글