본문으로 건너뛰기

[논문리뷰] Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yinhao Tang, Youqing Fang, Yanan Sun, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • No-CoT data: 명시적인 Chain-of-Thought(CoT) 주석 없이 문제와 결과(또는 도출 과정)만 포함된 데이터셋.
  • NCR (Next-Chunk Reasoning): No-CoT 데이터의 다음 텍스트 청크(Token 또는 Sentence)를 예측하도록 모델을 학습시키는 강화학습 기법.
  • Mixed SFT: No-CoT 데이터와 긴 Long-CoT 데이터를 하나의 Supervised Fine-Tuning 단계에서 결합하여 공동으로 학습시키는 방식.
  • RLVR (Reinforcement Learning with Verifiable Rewards): 정답 확인이 가능한 보상을 기반으로 모델의 추론 능력을 극대화하는 사후 학습 단계.
  • Pre-RLVR/Post-RLVR Accuracy: RLVR 적용 전후 모델의 추론 성능 지표로, 학습 전략의 효율성을 평가하는 핵심 기준.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 No-CoT 데이터를 활용한 추론 모델 학습 시, 최근 제안된 Next-Chunk Reasoning 기반의 Reinforcement Learning(RL) 방식이 기존의 Supervised Fine-Tuning(SFT) 전략보다 진정으로 우월한지 의문을 제기합니다 [Figure 1]. 기존 연구들은 NCR과 단순히 No-CoT 데이터만 학습한 SFT 베이스라인을 비교하여 NCR의 성능 향상을 주장해 왔으나, 이는 Long-CoT 구조를 파괴한다는 점에서 공정한 비교가 아닙니다. 저자들은 Long-CoT 형식과 No-CoT 데이터를 동시에 학습할 수 있는 Mixed SFT라는 새로운 베이스라인을 제시하고, 동일한 RLVR 예산 하에서 이 두 방식의 성능을 엄밀히 비교하고자 합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 Qwen3-30B-A3B-Base 모델을 기반으로 NTR(Next-Token Reasoning), NSR(Next-Sentence Reasoning), Sequential SFT, Mixed SFT 등 5가지 학습 전략을 비교했습니다. 실험 결과, Mixed SFT가 수학 및 일반 추론 벤치마크 모두에서 가장 높은 Post-RLVR 성능을 달성함을 확인했습니다 [Table 2]. 특히, Mixed SFTNCR 방식들보다 Training Compute 측면에서 60배 이상 효율적이면서도 더 높은 추론 성능을 보였습니다 [Figure 2]. 또한, Pre-RLVR 단계에서는 Mixed SFT가 가장 낮은 정확도를 보였음에도 불구하고, 최종 Post-RLVR에서는 가장 높은 정확도를 기록함으로써, 사후 학습 단계에서의 성능이 초기 지표와 반드시 비례하지 않음을 입증했습니다 [Figure 3]. 분석 결과, NCR의 학습 이득은 모델이 실제 추론 능력을 습득한 결과라기보다는 Local Completion에 따른 템플릿 복제 현상에 기인한 것임을 밝혔습니다 [Figure 6].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 No-CoT 데이터를 효과적으로 활용하기 위해 Next-Chunk Reasoning RL을 사용하는 것보다 Mixed SFT를 통한 데이터 구성이 훨씬 경제적이고 강력한 성능을 발휘함을 증명했습니다. 저자들은 Pre-RLVR 정확도가 모델의 잠재력을 과소평가할 수 있음을 지적하며, 추론 모델 학습 시 사후 학습 파이프라인 전체를 고려한 평가가 필수적임을 강조합니다. 이 연구는 연산 자원이 제한된 환경에서 복잡한 RL 기법 대신 효율적인 SFT 데이터 조합 전략이 추론 모델 성능 향상의 핵심임을 시사합니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글