[논문리뷰] Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It
링크: 논문 PDF로 바로 열기
메타데이터
저자: Tianrun Yu, Kaixiang Zhao, Shangzhe Li, Yuxiao Yang, Porter Jenkins, Weitong Zhang, Taylor W. Killian
1. Key Terms & Definitions (핵심 용어 및 정의)
- Training-Inference Mismatch: LLM의 RL post-training 과정에서 rollout을 생성하는 inference engine과 gradient를 계산하는 training engine의 수치적 구현 차이로 인해 동일한 토큰에 대해 서로 다른 확률을 할당하는 현상입니다.
- CIS (Calibrated Importance Sampling): 불일치를 log-odds displacement라는 새로운 좌표계에서 정의하고, 토큰 confidence에 비례하여 적응적으로 truncation을 수행하는 제안 방법론입니다.
- Log-odds Displacement ($\varepsilon_t$): 두 엔진 사이의 수치적 불일치를 나타내는 핵심 지표로, 두 엔진이 특정 토큰에 부여한 log-odds의 차이로 정의됩니다.
- Mixture-of-Experts (MoE): 모델의 gating network가 top-k 토큰을 선택하는 과정에서 발생하는 discrete decision으로 인해, 수치적 미세 차이가 전문가 경로(expert routing)의 변화를 유도하여 mismatch를 심화시키는 모델 구조입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM의 RLVR(Reinforcement Learning with Verifiable Rewards) 환경에서 발생하는 심각한 Training-Inference Mismatch 문제를 해결하고자 합니다. 기존 연구들은 단순히 고정된 임계값을 사용하는 Truncated Importance Sampling (TIS) 등의 휴리스틱 방식에 의존하고 있어, 토큰의 confidence와 관계없이 truncation bias가 저신뢰도 토큰에 과도하게 집중되는 한계가 있습니다 [Figure 1]. 이러한 방식은 특히 MoE 모델에서 routing 불일치로 인한 heavy tail 분포를 효과적으로 제어하지 못하며, 결과적으로 gradient 추정의 분산(variance) 문제를 악화시킵니다. 본 연구는 이러한 문제의 근본 원인을 통계적으로 분석하고, mismatch 자체의 구조에 기반한 principled한 교정 방식을 제안합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 CIS(Calibrated Importance Sampling)를 제안하여, 불일치를 토큰 confidence와 독립적인 log-odds displacement로 분해하고 이를 기반으로 적응적 truncation을 수행합니다. 제안된 방법론은 고정된 상수 임계값을 displacement 좌표계에 직접 적용함으로써, confidence가 높은 토큰일수록 더 타이트한 비율(ratio) cap을 자동으로 적용하여 불필요한 노이즈를 제거합니다 [Figure 1]. 또한, 수치적 안정성을 위해 floor 연산 ($\kappa$)을 도입하여 하한을 보장합니다 [Algorithm 1]. 실험 결과, CIS는 Qwen1.5-MoE-A2.7B-Chat, DeepSeek-V2-Lite, Qwen3-30B-A3B 등 3종의 MoE 모델과 5개 수학적 추론 벤치마크에서 기존의 TIS, IcePop, KPop 등 모든 베이스라인 대비 우수한 성능을 입증했습니다. 특히, CIS는 저신뢰도 토큰에 대한 편향을 최소화하면서 전체적인 모델의 held-out accuracy를 개선하는 정량적 우위를 보였습니다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Training-Inference Mismatch가 단순히 수치적 오차의 문제가 아니라 MoE 구조와 밀접하게 연관된 통계적 분포임을 규명하고, 이를 효과적으로 보정하는 CIS 프레임워크를 성공적으로 제안했습니다. 본 논문의 결과는 대규모 MoE 모델의 학습 안정성을 획기적으로 개선하며, 특히 고성능 LLM 학습 과정에서 필수적인 효율적인 gradient 추정 기술의 새로운 표준을 제시합니다. 이러한 접근 방식은 향후 분산 학습 및 다양한 모델 아키텍처 환경에서 보다 정교한 RL 최적화를 가능하게 할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — CIS 개념 및 동작 원리

Figure 2 — MoE와 Dense 모델의 오차 분포 비교

Figure 4 — 토큰 불확실성에 따른 displacement 분포
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] A Zeroth-Order Paradigm for LLM Preference Alignment
- [논문리뷰] It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
- [논문리뷰] StudentSim: Training LLM-based Student Simulators
- [논문리뷰] PaperGym: Rubric-Centered Evolution for Research-Plan Generation
- [논문리뷰] Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
Review 의 다른글
- 이전글 [논문리뷰] Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry
- 현재글 : [논문리뷰] Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It
- 다음글 [논문리뷰] RoboFoundry: System-as-Policy Evolution for Self-Learning Embodied Agents
댓글