[논문리뷰] Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers본 연구는 역사적 신문 자료의 불규칙한 레이아웃과 낮은 OCR 품질로 인해 학계의 계산적 접근이 제한되는 문제를 해결하고자 합니다. 기존의 전통적인 OCR 엔진은 복잡한 다단 구성이나 장식적 헤딩을 파싱하는 데 한계가 있으며, 대규모 데이터 처리에 필요한 비용 효율성을 확보하기 어렵습니다.#Review#Historical Newspapers#OCR#Vision-Language Models#Pipeline#Data Pipeline#Digital Humanities#Structured Datasets2026년 9월 2일댓글 수 로딩 중