[논문리뷰] PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
링크: 논문 PDF로 바로 열기
메타데이터
저자: Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan
1. Key Terms & Definitions (핵심 용어 및 정의)
- Layout-Grounded Parallel Decoding: 문서 레이아웃의 구조적 특성을 활용하여 콘텐츠 생성을 병렬화함으로써, 순차적 디코딩의 병목 현상을 해결하는 추론 기법.
- Prefix-Conditioned Factorization: 문서의 이미지와 레이아웃 접두사(prefix)를 공유 조건으로 활용하여 각 지역적 콘텐츠 생성을 조건부 독립적으로 분해하는 모델링 방식.
- Ancestor Attention: 학습 시 특정 노드(콘텐츠 또는 레이아웃)가 자신의 부모 노드(공유 접두사 등)에만 의존하도록 강제하여 병렬 구조를 학습시키는 메커니즘.
- vLLM Backend: 생성된 병렬 스트림을 독립적인 요청으로 처리하고, 공유 접두사에 대한 KV 캐시 재사용을 통해 메모리 및 연산 효율성을 극대화하는 serving 프레임워크.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 end-to-end 문서 파서가 가진 고질적인 순차적 디코딩 문제를 해결하기 위해 고안되었다 [Figure 1]. 기존 모델들은 전체 문서를 단일 autoregressive 시퀀스로 직렬화하여 처리하므로, 지역(region) 간 독립성에도 불구하고 전체 콘텐츠 길이에 비례하는 디코딩 depth를 갖게 되어 연산 효율성이 저하된다. 반면, crop-based 2단계 파서들은 병렬성은 제공하지만 반복적인 visual prefill과 파편화된 페이지 문맥으로 인해 전체적인 성능이 제한된다. 저자들은 이러한 제약 없이 레이아웃 구조를 기반으로 콘텐츠 생성을 병렬화하면서도 공유된 페이지 문맥을 보존하는 새로운 방법론의 필요성을 제기한다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 PaDoc을 제안하며, 이는 문서 레이아웃을 공유 페이지 표현 위의 분기 구조로 처리하는 layout-grounded 파서이다 [Figure 1]. PaDoc은 Prefix-Conditioned Factorization을 통해 레이아웃 스트림과 콘텐츠 브랜치를 동시에 진행하며, 디코딩 depth를 최장 레이아웃-콘텐츠 경로로 대폭 축소한다. 학습 시에는 packed variable-length ancestor attention을 사용하여 레이아웃과 콘텐츠 간의 의존성을 적절히 격리하면서도 표준적인 다음 토큰 예측 Objective를 유지한다 [Figure 1].
실험 결과, PaDoc은 OmniDocBench Full 벤치마크에서 Overall 점수 94.24를 기록하며 최고 수준의 end-to-end 파서 성능을 입증하였다 [Table 2]. 특히 효율성 측면에서 동일한 backbone의 Sequential SFT baseline 대비, valid-page throughput을 67.4–118% 향상시켰으며, P95 latency를 39.2–54.9% 감소시키는 성과를 거두었다 [Table 1, Table 2].
4. Conclusion & Impact (결론 및 시사점)
PaDoc은 문서 파싱 작업에서 레이아웃에 기반한 병렬 디코딩의 가능성을 이론적으로 증명하고 시스템적으로 구현하였다. 이 연구는 단일 MLLM 내에서 복잡한 문서 구조를 효율적으로 파싱할 수 있는 프레임워크를 제공하여, 학계와 산업계의 문서 이해(Document Intelligence) 시스템에 중요한 효율성 향상을 가져올 것으로 기대된다. 특히, 명시적인 보조 헤드 없이도 표준적 학습 방식을 통해 높은 처리량과 낮은 지연 시간을 달성함으로써 차세대 문서 파서 개발의 핵심적인 가이드라인을 제시한다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] HPD-Parsing: Hierarchical Parallel Document Parsing
- [논문리뷰] Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
- [논문리뷰] Motif 3: Technical Report
- [논문리뷰] DiffusionGemma Technical Report
- [논문리뷰] Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
Review 의 다른글
- 이전글 [논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning
- 현재글 : [논문리뷰] PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
- 다음글 [논문리뷰] SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
댓글