[논문리뷰] NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
링크: 논문 PDF로 바로 열기
메타데이터
저자: Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun
1. Key Terms & Definitions (핵심 용어 및 정의)
- NaviDC-OCR: 디지털 및 카메라 촬영 문서의 변형(deformation)을 통합적으로 처리하여 파싱 성능을 극대화하는 통합 프레임워크입니다.
- Deformation-aware Learning: 카메라로 촬영된 문서의 기하학적 왜곡을 Vision-Language Model(VLM)이 직접 학습하도록 하여 별도의 dewarping 모듈 없이 정교한 구조적 표현을 생성하는 기법입니다.
- Content-Structure Decoupled Learning: 수식 및 표와 같이 구조가 복잡한 데이터에서 구조적 정보 예측과 내용 생성을 분리하여 최적화 복잡도를 낮추는 학습 전략입니다.
- Multi-node Consensus Voting (MCV): 이기종 모델 간의 예측 일치도를 분석하여 고품질의 Pseudo-label을 생성함으로써 단일 모델의 편향을 방지하는 데이터 엔진 핵심 기술입니다.
- Curvature-Guided Douglas–Peucker Sampling (CGDP): 문서 경계의 기하학적 특성에 따라 샘플링 밀도를 동적으로 조절하여 복잡한 레이아웃을 효율적으로 표현하는 샘플링 방법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 디지털 문서와 카메라 촬영 문서 간의 파싱 격차를 해소하고, 복잡한 문서 구조를 정확하게 인식하기 위한 통합 솔루션 부재 문제를 해결합니다. 기존의 decoupled 방식은 레이아웃 분석 단계의 기하학적 왜곡이 후속 파싱에 오차를 누적시키는 치명적인 한계가 있으며, end-to-end 방식은 고해상도 환경에서 구조적 추론 능력이 부족하거나 불필요한 환각(hallucination)을 생성하는 문제가 있습니다 [Figure 1]. 이러한 한계로 인해 저자들은 문서 파싱의 기하학적 인식 능력을 VLM에 내재화하고, 구조와 내용을 분리하여 학습하는 새로운 패러다임이 필요하다고 판단하였습니다.

Figure 1 — NaviDC-OCR 성능 개요
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 NaviDC-OCR 프레임워크를 제안하며, 이는 데이터 엔지니어링, Deformation-aware 학습, 구조적 디커플링을 핵심으로 합니다. 데이터 측면에서는 MCV를 통해 고품질 Pseudo-label을 확보하고, CGDP를 적용하여 기하학적 복잡도를 효과적으로 캡처합니다 [Figure 2]. 학습 전략으로는 4단계 프로그레시브 학습을 채택하여 기본 OCR 역량 강화부터 왜곡 인식, 내용-구조 디커플링까지 점진적으로 모델을 고도화합니다 [Figure 3]. 특히 표와 수식 같은 복잡한 요소에 대해 구조(예: OTSL)를 먼저 예측하고 내용을 채우는 방식으로 모델의 최적화 Coupling 문제를 해결하였습니다. 실험 결과, OmniDocBench v1.6에서 96.87점, Wild-OmniDocBench에서 88.53점의 높은 성능을 기록하였으며, ICDAR 2026 Sci-ImageMiner Challenge에서 1위를 차지하며 SOTA를 달성했습니다.

Figure 2 — 데이터 엔지니어링 파이프라인

Figure 3 — 핵심 학습 전략 아키텍처
4. Conclusion & Impact (결론 및 시사점)
본 논문은 디지털과 카메라 촬영 문서를 아우르는 통합된 문서 파싱 프레임워크인 NaviDC-OCR을 성공적으로 구축하였습니다. 본 연구는 복잡한 기하학적 왜곡과 구조적 정보를 VLM 내부에 명시적으로 모델링함으로써 기존 파싱 시스템의 한계를 극복했습니다. 이 프레임워크는 향후 RAG(Retrieval-Augmented Generation) 시스템이나 고품질 데이터 파이프라인 구축에 있어 핵심적인 기술적 기반을 제공할 것으로 기대됩니다. 또한 제안된 기법들은 학계와 산업계 전반에 걸쳐 문서 인식 및 자동화 기술의 정확도와 강건성을 한 단계 끌어올리는 중요한 전환점이 될 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] HPD-Parsing: Hierarchical Parallel Document Parsing
- [논문리뷰] HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- [논문리뷰] DocAtlas: Multilingual Document Understanding Across 80+ Languages
- [논문리뷰] MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
- [논문리뷰] Multimodal OCR: Parse Anything from Documents
Review 의 다른글
- 이전글 [논문리뷰] MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling
- 현재글 : [논문리뷰] NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- 다음글 [논문리뷰] PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
댓글