[논문리뷰] ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
링크: 논문 PDF로 바로 열기
메타데이터
저자: Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo
1. Key Terms & Definitions (핵심 용어 및 정의)
- Schema-Guided Extraction: 사용자가 정의한
JSON Schema를 기반으로 다양한 문서에서 정형 데이터를 추출하는 과업을 지칭합니다. - Visual Grounding: 추출된 값이 문서의 어느 위치(Page, Bounding Box)에서 도출되었는지에 대한 근거를 제공하여 시스템의 신뢰성을 확보하는 기술입니다.
- Task Challenges: 문서 추출의 난이도를 결정하는 핵심 요소로,
Long-list completeness,Needle-in-haystack,Dense documents등으로 분류됩니다. - Perception Challenges: 스캔 노이즈, 필기체, 복잡한 테이블 구조 등 문서의 물리적 특성으로 인해 발생하는 추출 실패 요인을 의미합니다.
- Extraction Pipeline: 문서로부터 구조화된 출력을 생성하기 위해 사용되는 모델 조합이나 에이전트 시스템을 의미합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기업 환경의 복잡하고 방대한 문서 처리 자동화를 위해 필수적인 schema-guided extraction의 성능과 신뢰성을 정량적으로 평가할 수 있는 통합 벤치마크를 제안합니다. 기존의 문서 정보 추출(IE) 벤치마크들은 고정된 템플릿에 의존하거나, 특정 과업(예: 리스트 추출)에만 국한되어 있어 실제 기업 현장에서 요구하는 비용, 시각적 근거(Grounding), 복잡한 문서 구조 처리 능력을 모두 평가하기에 한계가 있습니다 [Table 1]. 따라서 저자들은 실제 기업 환경의 다양한 문서 도메인을 포괄하고, 모델의 성능뿐만 아니라 비용 효율성까지 종합적으로 측정할 수 있는 새로운 표준인 ExtractBench의 필요성을 강조합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
ExtractBench는 8개 비즈니스 도메인과 67개 문서 유형에 걸친 370개의 문서(총 4,869페이지)를 포함하며, 과업 난이도, 문서 길이, 시각적 인식 과제 등을 태깅하여 다차원적인 분석을 지원합니다 [Figure 1]. 저자들은 고품질의 Ground Truth를 확보하기 위해 Frontier 모델 앙상블, 프로그래밍 기반의 합성 리스트 생성, 그리고 인간 검증을 결합한 확장 가능한 데이터 구축 파이프라인을 설계했습니다 [Figure 2]. 실험에서는 상용 VLM, Coding agents, 특화된 Extraction API 등 14개 시스템을 대상으로 성능을 비교했습니다. 결과적으로, LlamaExtract Agentic Plus 모델이 Short 문서(96.6%)와 Long 문서(94.4%) 모두에서 일관되게 우수한 성능을 보였으며, Codex GPT-5.5 대비 낮은 비용으로 더 높은 정확도를 달성했습니다 [Table 2]. 또한, 많은 상용 모델이 Word-level grounding 기능을 지원하지 않아 실무 적용에 한계가 있음을 확인했습니다 [Table 3, Figure 3].

Figure 1 — ExtractBench의 5개 태그 축별 커버리지

Figure 2 — Ground Truth 생성 파이프라인
4. Conclusion & Impact (결론 및 시사점)
본 논문은 기업용 문서 추출 시스템의 성능을 종합적으로 평가하는 최초의 도전적인 벤치마크인 ExtractBench를 성공적으로 구축하였습니다. 이 연구는 모델의 단순 정확도를 넘어 비용, 신뢰성(Grounding), 그리고 복잡한 문서 처리 능력을 체계화함으로써 기업의 AI 도입 결정에 실질적인 기준을 제공합니다. 향후 본 연구의 방법론과 데이터셋은 자동화된 엔터프라이즈 AI 워크플로우를 최적화하고, 더 신뢰할 수 있는 에이전트 시스템을 개발하는 데 중요한 기여를 할 것으로 기대됩니다.

Figure 3 — 모델별 품질-비용 효율성 비교
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
- [논문리뷰] SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
- [논문리뷰] Novel Claim or Déjà Vu? Rethinking 'Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
- [논문리뷰] WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
- [논문리뷰] When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
Review 의 다른글
- 이전글 [논문리뷰] Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- 현재글 : [논문리뷰] ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- 다음글 [논문리뷰] Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants
댓글