[논문리뷰] Understanding Reasoning from Pretraining to Post-Training
링크: 논문 PDF로 바로 열기
메타데이터
저자: Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov
1. Key Terms & Definitions (핵심 용어 및 정의)
- Pretraining-to-RL Interface: 대규모 사전 학습(
Pretraining)과 그 이후의 강화 학습(RL) 단계가 상호작용하는 지점 및 성능 영향력을 지칭함. - Verifiable Reward: 체스 퍼즐과 같이 게임 규칙이나 엔진을 통해 명확한 정답 여부가 확인 가능한 보상 체계.
- Pass@k: 모델이 생성한
k개의 후보 출력 중 적어도 하나가 정답(골든 솔루션)과 일치할 확률을 측정하는 성능 지표. - IsoFLOP Curves: 동일한 연산량(
FLOPs)을 투입했을 때 모델 파라미터 수와 데이터 양의 조합에 따른 성능 변화를 나타내는 곡선.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 LLM 훈련 과정에서 Pretraining 단계의 선택(모델 크기, 데이터 등)이 이후 RL 효율성에 미치는 정량적 관계를 규명하고자 한다. 기존 연구들은 Pretraining과 RL의 scaling 법칙을 개별적으로 다루었으나, 고정된 전체 연산 예산 내에서 두 단계에 자원을 어떻게 배분하는 것이 최적인지에 대한 근거가 부족했다 [Figure 1]. 또한, RL이 단순히 기존 모델의 정책을 정교화(Sharpening)하는 것인지, 아니면 새로운 능력을 발견(Discovery)하는 것인지에 대한 학계의 이견이 존재한다. 본 연구는 체스라는 통제된 환경을 통해 이러한 의문들을 체계적으로 분석한다.

Figure 1 — 체스 기반 연구 프레임워크 개요
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 체스 게임을 LLM 훈련 파이프라인(Pretraining-SFT-RL)의 대리 환경으로 사용하여 5M에서 1B 파라미터에 이르는 모델들을 대상으로 대규모 실험을 수행하였다. 연구 결과, Pretraining 단계의 손실 값(Loss)이 RL 이후의 하향식 성능을 강력하게 예측한다는 것을 확인하였으며, RL의 성능 향상 속도(Slope)는 Pretraining 토큰 수에 선형적으로 비례함을 발견했다 [Figure 3]. 성능 비교 결과, Pass@1 지표에서 RL은 고정된 연산량 조건에서 일관된 성능 향상을 보였으나, Pass@16에서는 RL의 추가 투입보다 Pretraining 강화가 더 효과적인 경우도 존재함을 확인하였다 [Figure 2]. 기계론적 분석 결과, 쉬운 퍼즐에서는 SFT 단계의 선호도를 강화(Amplifying)하는 반면, 어려운 퍼즐에서는 SFT에서 거의 나타나지 않던 정답 경로를 표면화(Surfacing)할 수 있음을 증명하였다. 이러한 패턴은 수학 도메인 모델에서도 일관되게 관찰되어 일반화 가능성을 입증했다.

Figure 2 — 연산량 배분에 따른 성능 파레토 프론티어

Figure 3 — 사전 학습 속성이 RL 성능에 미치는 예측 모델
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Pretraining과 RL 간의 상호작용을 정량적인 Scaling 법칙으로 정의하고, 연산량 배분의 최적화 지점을 제시하였다. 이 연구는 대규모 모델 훈련 시 경험적 추측에 의존하던 자원 배분 전략을 데이터 기반의 의사결정으로 전환하는 데 기여한다. 특히, RL이 도달할 수 있는 성능 한계와 효율적인 학습 전략을 명확히 함으로써, 향후 Reasoning 능력이 중요한 LLM 개발에 핵심적인 지침을 제공할 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
- [논문리뷰] daVinci-LLM:Towards the Science of Pretraining
- [논문리뷰] PretrainZero: Reinforcement Active Pretraining
- [논문리뷰] LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
- [논문리뷰] DCPO: Dynamic Clipping Policy Optimization
Review 의 다른글
- 이전글 [논문리뷰] See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
- 현재글 : [논문리뷰] Understanding Reasoning from Pretraining to Post-Training
- 다음글 [논문리뷰] VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
댓글