본문으로 건너뛰기

[논문리뷰] Follow the Entities: A Corpus Map for Agentic Search

링크: 논문 PDF로 바로 열기

메타데이터

저자: Soyeong Jeong, Sujay Kumar Jauhar, Sung Ju Hwang, Andrew Joohun Nam


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Agentic Search: LLM Agent가 전체 Corpus 내에서 단계적으로 도구를 사용하여 정보를 탐색하고, 복합적인 질문에 답하기 위해 여러 문서를 연결하여 근거를 수집하는 방식입니다.
  • CorpusMap: Corpus 내의 반복적인 Entity를 중심으로 문서를 연결하여 재사용 가능한 탐색 레이어를 구축하는 Entity-centric 구조입니다.
  • Entity Page: 특정 Entity와 관련된 모든 문서를 집약하고, 해당 Entity에 대한 사실과 출처를 제공하여 Agent가 근거를 효과적으로 탐색할 수 있도록 돕는 탐색 노드입니다.
  • Cross-document Coreference: 서로 다른 문서에 흩어져 있는 동일한 Entity에 대한 언급을 식별하고 이를 하나의 공유된 Entity로 결합하는 과정입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 대규모 문서 집합에서 정보를 찾는 기존 Agentic Search가 가진 비효율성과 정보 누락 문제를 해결하고자 합니다. 기존 방식은 Corpus를 단순히 평면적인 문서 집합으로만 처리하므로, Agent가 질문을 받을 때마다 문서 간의 관계를 매번 새롭게 추론해야 하는 한계가 있습니다. 이러한 방식은 쿼리 독립적이지 못해 동일한 정보를 찾기 위해 많은 Token을 소모하게 하며, 문서 간 관계가 명시되지 않아 연관된 정보를 놓칠 가능성이 큽니다. 따라서 본 연구는 Corpus 내의 Entity를 활용하여 고정된 Navigation Layer를 구축하고, 이를 통해 문서 간의 연결성을 명시적으로 노출하고자 합니다 [Figure 2].

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 Corpus를 오프라인에서 미리 처리하여 Entity-centric 탐색 지도를 구축하는 CorpusMap을 제안합니다. 이 방법론은 Cataloging, Extraction, Resolution, Rendering 단계를 거쳐 Entity Page를 생성하고, 이를 통해 Agent가 문서 간의 그래프 구조를 따라 효율적으로 탐색하도록 유도합니다. 실험 결과, CorpusMap은 Raw-corpus 방식 대비 여러 벤치마크에서 Answer Quality를 6.4~11.7 포인트 개선하는 우수한 성능을 보였습니다 [Table 1]. 또한, 추론 과정에서 Input Token 소비량을 34%에서 최대 57%까지 절감하는 효율성을 입증하였습니다 [Figure 1]. 이는 고정된 검색 컨텍스트에 의존하는 기존 Retrieval-based 방식보다 더 높은 완성도의 답변을 제공함을 의미합니다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 대규모 문서 집합에 대한 Agent의 탐색 능력을 향상시키기 위해서는 검색 방식뿐만 아니라 Corpus 자체의 조직화가 필수적임을 강조합니다. CorpusMap은 Entity를 탐색의 앵커(anchor)로 활용함으로써 더 적은 자원으로도 복합적인 정보를 효과적으로 연결할 수 있음을 입증했습니다. 이는 향후 기업용 지식 관리 시스템이나 대규모 데이터 기반의 Agentic 시스템 설계에 있어 중요한 설계 지침을 제공할 것으로 기대됩니다.


Part 2: 중요 Figure 정보

Figure 1: 모델 품질 및 추론 비용 비교

Figure 1 — 모델 품질 및 추론 비용 비교

Figure 2: CorpusMap 아키텍처

Figure 2 — CorpusMap 아키텍처

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글