[논문리뷰] BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
링크: 논문 PDF로 바로 열기
메타데이터
저자: Pengyu Wang, Benfeng Xu, Shaohan Wang, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- RAG (Retrieval-Augmented Generation): 외부 Corpus를 참조하여 LLM의 출력 정확도를 향상시키는 기법입니다.
- EnterpriseRAG-Bench: 본 논문에서 사용된, 511,959개의 문서로 구성된 기업형 문서 기반 평가 벤치마크입니다.
- Scaling Ladder: Corpus의 크기를 28개의 중첩된 tier로 나누어, 최소 단위에서 최대 규모까지 체계적으로 성능과 비용을 측정하는 방법론입니다.
- File-System Agent: 인덱스 없이 Raw file tree를 LLM의 Tool call을 통해 직접 탐색하는 방식의 에이전트입니다.
- Build Cost / Query Cost: 시스템 구축에 필요한 토큰(Embedding/Generative)과 실제 질의 수행 시 발생하는 토큰 및 Latency를 구분하여 측정한 비용 지표입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 RAG 패러다임들이 다양한 규모의 Corpus에서 어떻게 성능과 비용적으로 확장되는지에 대한 불확실성을 해결하고자 합니다. 기존 연구들은 대체로 고정된 크기의 Corpus에서 특정 패러다임만을 단독 평가하여, 실제 기업 환경과 같이 데이터가 지속적으로 증가하는 상황에서의 확장성을 파악하기 어려웠습니다 [Figure 2]. 특히 Lexical, Dense, Graph-based RAG, 그리고 Agentic Search 간의 정확도-비용 트레이드오프가 데이터 규모 성장에 따라 어떻게 변하는지가 명확히 밝혀지지 않았습니다. 본 연구는 450배 규모로 확장되는 28개의 Nested Tier를 통해 이러한 확장성 문제를 엄격하게 제어된 환경에서 분석합니다.

Figure 2 — 평가 방법론 및 파이프라인
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 28개의 계층적 Tier로 구성된 Corpus Ladder를 활용하여 7개의 주요 RAG 파이프라인을 동일한 Reader Model 및 평가지표로 비교하는 통합 평가 프레임워크를 제안합니다 [Figure 2]. 실험 결과, 규모에 따라 승자가 바뀌는 'Scale-dependent Crossover' 현상이 관측되었습니다 [Figure 1]. 초소규모에서는 File-System Agent가 우수한 성능을 보이나, 약 10M Corpus Token을 기점으로 BM25가 성능을 추월하며 규모가 커질수록 격차가 벌어져 최대 규모에서는 약 20포인트 이상의 성능 우위를 점합니다 [Figure 3]. BM25는 추가적인 LLM 기반 인덱싱 비용 없이도 최고의 비용 효율성(Pareto frontier)을 보여주었습니다. 반면, Graph-based RAG 계열은 높은 구축 비용과 확장성 한계(Construction Wall)에 직면하며, 대규모 Tier에서는 BM25 대비 낮은 성능을 기록했습니다 [Table 1]. 이러한 결과는 단순 탐색보다 Global Candidate Ranking이 대규모 Corpus에서 훨씬 강력한 Default가 됨을 시사합니다.

Figure 1 — 규모에 따른 성능 교차점

Figure 3 — Tier별 공식 성능 곡선
4. Conclusion & Impact (결론 및 시사점)
본 논문은 기업형 Corpus 환경에서 규모의 증가가 Lexical Retrieval 방식을 더욱 유리하게 만든다는 점을 입증하며, RAG 패러다임 선택에 있어 확장성 고려의 중요성을 강조합니다. 대규모 데이터셋에서는 BM25를 이용한 글로벌 랭킹을 선행하고, 이후 단계에서 에이전트의 Reasoning을 활용하는 것이 가장 효과적인 접근법임을 제시합니다. 본 연구의 결과는 향후 RAG 시스템 설계 시 인덱싱 비용과 운영 규모 간의 균형을 맞추는 데 있어 중요한 실무적 가이드라인이 될 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents
- [논문리뷰] Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
- [논문리뷰] GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
- [논문리뷰] UEmbed: Unified Sparse and Dense Multimodal Embeddings
- [논문리뷰] EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
Review 의 다른글
- 이전글 [논문리뷰] AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
- 현재글 : [논문리뷰] BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
- 다음글 [논문리뷰] Beacon: Knowing When and How to Perform Agentic Visual Reasoning
댓글