[논문리뷰] Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
링크: 논문 PDF로 바로 열기
메타데이터
저자: Matteo Cargnelutti, Catherine Brobston, Eben English, Jake Sadow, Kacie Bailey, Greg Leppert, Amanda Watson, Jessica Chapel, Jonathan Zittrain
## 1. Key Terms & Definitions (핵심 용어 및 정의)
- Institutional Newspapers Pipeline: 역사적 신문 스캔 데이터로부터 고품질의 구조화된 데이터셋을 추출하기 위해 설계된 모듈형 파이프라인입니다.
- Crop: 신문 스캔 페이지 내에서 텍스트나 시각적 요소가 중단 없이 이어지는 독립적인 구역으로, 본 파이프라인의 Atomic한 처리 단위입니다.
- dots.mocr: 신문 스캔의 표 파싱 및 다국어 처리에 특화된 3B 파라미터 규모의 Vision-Language Model(VLM)입니다.
- o200k_base: OpenAI에서 제공하는 토큰화 모델로, 본 연구에서 데이터 규모 측정 지표로 활용되었습니다.
## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 역사적 신문 자료의 불규칙한 레이아웃과 낮은 OCR 품질로 인해 학계의 계산적 접근이 제한되는 문제를 해결하고자 합니다. 기존의 전통적인 OCR 엔진은 복잡한 다단 구성이나 장식적 헤딩을 파싱하는 데 한계가 있으며, 대규모 데이터 처리에 필요한 비용 효율성을 확보하기 어렵습니다. 저자들은 Boston Public Library와 협력하여, workstation-grade 하드웨어 환경에서도 운용 가능한 모듈형 파이프라인을 구축하여 역사적 기록을 효율적으로 디지털화하고 연구 가치를 극대화하는 것을 목표로 합니다. [Figure 1]은 이 파이프라인이 하나의 신문 스캔 페이지를 어떻게 계층적으로 분석하고 구조화하는지 보여줍니다.

Figure 1 — 파이프라인의 계층적 데이터 추출 구조를 시각화한 핵심 다이어그램
## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 파이프라인은 신문 페이지를 Atomic한 Crop으로 세분화하고, 각각에 대해 OCR, 유형 분류, 읽기 순서 감지, NER, 주제 감지 및 임베딩 생성을 순차적으로 수행합니다. Segmentation 과정에서는 YOLO26x 모델을 활용하여 레이아웃을 정교하게 분석하며, OCR 단계에서는 Tesseract와 특화된 VLM인 dots.mocr을 결합하여 텍스트 추출 정확도를 높였습니다. [Table 3]에 따르면 dots.mocr은 Tesseract보다 약 11.2% 많은 총 16.3 billion 개의 토큰을 성공적으로 생성했습니다. 또한 Crop-type classification 모델은 이미지와 텍스트 신호를 결합하여 90.55%의 일치율을 기록하며, 시각적 정보와 텍스트 정보를 상호보완적으로 처리하여 분류 정확도를 확보했습니다. 실험 결과, 총 1,473,635개의 스캔에서 83.1 million 개의 Crop이 추출되었으며, 이는 인문학 연구를 위한 새로운 대규모 데이터셋으로 기능합니다. [Table 6]은 읽기 순서 감지 성능을 평가하는데, 전체적으로 80.8%의 micro position accuracy를 달성했습니다.

Table 3 — 두 OCR 기법의 데이터 추출 성능을 정량적으로 비교한 핵심 지표 테이블

Table 6 — 읽기 순서 감지 모델의 성능을 평가한 결과 테이블
## 4. Conclusion & Impact (결론 및 시사점) 본 연구는 대규모 역사적 신문 자료를 디지털 환경에서 활용할 수 있는 자동화된 파이프라인을 구축함으로써 데이터 접근성을 크게 향상시켰습니다. 본 파이프라인을 통해 공개된 고품질 데이터셋은 향후 LLM의 학습 데이터 개선 및 다양한 디지털 인문학 연구의 기반이 될 것으로 기대됩니다. 저자들은 향후 복잡한 레이아웃에 대한 파싱 능력을 강화하고 파이프라인의 연산 효율을 더욱 높이는 방향으로 모델을 고도화할 계획임을 밝혔습니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- [논문리뷰] DocAtlas: Multilingual Document Understanding Across 80+ Languages
- [논문리뷰] WorldReward: Reward Modeling for Camera-Conditioned World Models
- [논문리뷰] Principia: Relational Physics Tests for Video Models
- [논문리뷰] On the Design Fundamentals of Pixel Text Representation Learning
Review 의 다른글
- 이전글 [논문리뷰] Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation
- 현재글 : [논문리뷰] Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
- 다음글 [논문리뷰] It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
댓글