[논문리뷰] Scaling Domain Data Repetition in LLM Pretraining
링크: 논문 PDF로 바로 열기
저자: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang
## 1. Key Terms & Definitions (핵심 용어 및 정의)
- TPP (Tokens-per-parameter ratio): 모델의 전체 파라미터 수 대비 학습에 사용된 총 토큰 수의 비율($D/N$)로, 컴퓨팅 예산 할당의 핵심 지표입니다.
- Data Repetition: 유한한 고품질 도메인 데이터를 여러 에폭(epoch) 동안 반복하여 학습함으로써 데이터 부족 문제를 완화하는 기법입니다.
- Validation Loss: 모델의 학습 효율과 일반화 성능을 평가하기 위한 척도로, 본 논문에서는 in-distribution(ID) 및 out-of-distribution(OOD) 손실을 모두 측정합니다.
- Unique Data Fraction ($\alpha$): 전체 학습 토큰 중 특정 도메인의 고유한 데이터가 차지하는 비율을 의미하며, 학습 데이터 구성을 결정하는 주요 파라미터입니다.
## 2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 연구는 모델 규모가 커질수록 컴퓨팅 최적화 학습을 위해 더 많은 토큰이 필요하지만, 고품질 도메인 데이터 확보가 어렵다는 불균형 문제를 해결하고자 합니다. 기존 연구들은 단순히 데이터 규모를 고정하거나 TPP를 고려하지 않아, 대규모 모델에서 데이터 반복 시 발생하는 조기 과적합(Overfitting) 문제를 잘못 해석하는 경향이 있었습니다. 저자들은 실제 LLM 스케일링 환경인 fixed-TPP 설정 하에서 데이터 반복이 성능에 미치는 영향을 체계적으로 규명하고자 합니다. [Figure 1]에서 확인할 수 있듯이, 고정된 학습 데이터 크기 하에서는 반복 횟수가 증가할수록 성능이 빠르게 저하되나, 모델 규모와 함께 토큰 예산이 증가하는 실제 환경에서는 반복 횟수의 최적점이 달라질 수 있음을 입증합니다.

Figure 1 — Fixed-data 크기 vs Fixed-TPP 환경에서의 반복 학습 성능 차이를 보여주는 핵심 비교 다이어그램
## 3. Method & Key Results (제안 방법론 및 핵심 결과)
본 연구는 Code, Math, Wiki, Medical 등 4개 고품질 도메인을 대상으로 fixed-TPP 스케일링 설정 하에서 데이터 반복 횟수와 유니크 데이터 비율($\alpha$)을 체계적으로 변화시키며 실험을 수행합니다. 실험 결과, 최적의 반복 횟수는 도메인의 최종 Validation Loss와 강한 음의 상관관계($-0.944$)를 보이며, 손실이 낮은 도메인일수록 더 많은 반복을 견디고 성능 이득을 얻을 수 있음을 발견하였습니다. 특히 모델 크기가 커짐에 따라 최적의 반복 횟수가 완만하게 증가하는 경향을 확인하였으며, 이는 소규모 프록시 모델에서 튜닝된 반복 횟수가 대규모 모델에서도 안전한 기준점이 될 수 있음을 시사합니다. [Figure 3]은 이러한 도메인별 의존성과 모델 크기 증가에 따른 변화를 시각적으로 보여줍니다. 또한, 반복 횟수는 유니크 데이터 비율($\alpha$)에는 크게 민감하지 않아, 프록시 학습 시 대표적인 비율만 사용해도 무방하다는 실용적인 가이드라인을 제시합니다.

Figure 3 — 도메인, 모델 크기, 유니크 데이터 비율이 반복 횟수 최적점에 미치는 영향을 분석한 결과
## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 대규모 LLM 학습 시 도메인 데이터 반복이 필수적인 전략임을 입증하고, 이에 대한 체계적인 스케일링 법칙을 확립했습니다. 연구 결과는 모델 크기와 TPP가 고정된 상황에서 최적의 반복 횟수를 도메인 특성에 맞게 조정하는 것이 중요함을 강조합니다. 제안된 프록시 모델 기반의 반복 횟수 추정 방법론은 향후 LLM 프리트레이닝 데이터 설계 과정에서 컴퓨팅 자원을 절약하고 데이터 활용 효율을 극대화하는 실무적인 방법론으로 활용될 것입니다.

Figure 4 — 최종 검증 손실과 반복 횟수 간의 강한 음의 상관관계를 보여주는 정량적 분석 그래프
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
- [논문리뷰] Does DINOv3 Set a New Medical Vision Standard?
- [논문리뷰] Scaling Inherently Interpretable Language Models
- [논문리뷰] LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- [논문리뷰] Scaling Properties of Text Conditioning in Visual Generation
Review 의 다른글
- 이전글 [논문리뷰] SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
- 현재글 : [논문리뷰] Scaling Domain Data Repetition in LLM Pretraining
- 다음글 [논문리뷰] Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
댓글