[논문리뷰] GRASP: GRanularity-Aware Search Policy for Agentic RAG
링크: 논문 PDF로 바로 열기
메타데이터
저자: Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan
1. Key Terms & Definitions (핵심 용어 및 정의)
- Agentic RAG: LLM이 단일 단계 검색을 넘어, 추론, 검색 쿼리 생성, 증거 수집, 답변 합성을 반복적으로 수행하는 프레임워크.
- Granularity-Aware Search Policy (GRASP): 검색 도구(Semantic/Keyword)와 문맥 세분화 수준을 학습된 RL 정책을 통해 동적으로 제어하여 최적의 evidence를 확보하는 방법론.
- Complementary Retrieval:
Semantic search와Keyword search를 상호보완적으로 사용하여 lexical mismatch 문제와 의미론적 연결성을 동시에 해결하는 전략. - Group-Relative Policy Optimization (GRPO): 샘플링된 그룹 내의 다중 Trajectory 간의 상대적 보상을 비교하여 최적의 검색 정책을 학습하는 알고리즘.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Agentic RAG 시스템에서 발생하는 불필요한 노이즈와 잘못된 검색 결정을 방지하고, 다중 단계 추론의 정확도를 높이는 문제를 해결한다. 기존의 Static RAG는 단일 검색으로 인한 정보 부족과 coarse-grained 문맥으로 인한 hallucination 문제에 취약하다. 또한, 기존 Agentic RAG 연구들은 검색 도구의 통합적 활용과 evidence granularity 조절 능력 부족으로 인해 Reasoning Chain이 쉽게 파손된다 [Figure 1]. 따라서 본 연구는 모델이 검색 시점, 검색 방식, 그리고 evidence의 세분화 수준을 스스로 결정하는 적응형 정책 학습의 필요성을 제시한다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 강화학습을 기반으로 하는 GRASP 프레임워크를 제안하여 모델이 다단계 추론 과정에서 Semantic search, Keyword search, Read paragraph 도구를 전략적으로 호출하도록 학습시킨다 [Figure 2]. 보상 설계(Reward Design)는 Answer Accuracy (RAR_A), Grounded Reading (RRR_R), Complementary Search (RSR_S), Turn Efficiency (RER_E)를 결합하여 모델이 최적의 evidence를 선별하도록 유도한다. 실험 결과, GRASP는 HotpotQA, 2WikiMultiHopQA, MuSiQue 벤치마크에서 기존의 Single-step retrieval 및 Search-R1과 같은 RL 기반 Baseline 대비 우수한 성능을 입증하였다. 특히 GRASP는 HotpotQA에서 0.90의 높은 Recall을 기록하였으며, 질문 답변(QA) 품질 지표인 EM 및 F1 점수에서도 가장 뛰어난 성능을 보였다 [Table 1, Table 2]. Ablation Study를 통해 Semantic search와 Keyword search의 상호보완적 역할과 적절한 granularity 제어가 최종 성능에 필수적임을 정량적으로 증명하였다 [Table 3].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Agentic RAG에서 검색 행동을 RL로 최적화함으로써 성능을 극대화할 수 있음을 입증하였다. 특히, 학습된 정책이 인간의 정보 탐색 행위(Information Foraging)와 유사한 skim-and-scan 패턴을 보인다는 점은 모델의 검색 전략이 매우 해석 가능하다는 점을 시사한다. 이 연구는 대규모 언어 모델이 단순히 외부 지식을 참조하는 단계를 넘어, 최적의 evidence를 스스로 선별하고 관리하는 방향으로의 기술적 전환을 제시하며 실질적인 RAG 시스템 성능 향상에 크게 기여할 것으로 기대된다.
Part 2: 중요 Figure 정보

Figure 1 — 다중 단계 추론 시 문맥 조절의 중요성

Figure 2 — GRASP 프레임워크 개요
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
- [논문리뷰] Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
- [논문리뷰] Step-DeepResearch Technical Report
- [논문리뷰] End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
- [논문리뷰] Understanding Reasoning from Pretraining to Post-Training
Review 의 다른글
- 이전글 [논문리뷰] From Pixels to States: Rethinking Interactive World Models as Game Engines
- 현재글 : [논문리뷰] GRASP: GRanularity-Aware Search Policy for Agentic RAG
- 다음글 [논문리뷰] LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
댓글