[논문리뷰] OvisOCR2 Technical Report
링크: 논문 PDF로 바로 열기
메타데이터
저자: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo
1. Key Terms & Definitions (핵심 용어 및 정의)
- End-to-End Document Parsing: 별도의 레이아웃 분석 및 영역별 병합 과정 없이, 단일 모델이 문서 이미지를 입력받아 즉시 구조화된 Markdown 포맷을 생성하는 방식.
- Data Engine: 실제 문서의 파싱 결과와 정교하게 설계된 합성 데이터를 결합하여, Markdown 출력의 정확성과 구조적 타당성을 확보하는 데이터 구축 파이프라인 [Figure 2].
- GRPO (Group Relative Policy Optimization): Reinforcement Learning 알고리즘으로, 하나의 프롬프트에 대해 여러 출력을 샘플링하고 보상 함수(Reward Function)를 기반으로 상대적인 이점을 계산하여 모델을 최적화함.
- OPD (On-policy Distillation): 대규모 모델(4B teacher)의 지식을 소형 모델(0.8B student)로 전이하기 위해, 모델의 현재 정책(On-policy) 상에서 토큰 단위 분포를 일치시키는 증류 기법 [Figure 4].

Figure 2 — 데이터 엔진 아키텍처
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 문서 파싱 방식인 파이프라인(Pipeline) 모델의 복잡한 배포 구조와 단계별 오류 누적 문제를 해결하고자 OvisOCR2를 제안한다. 기존의 파이프라인 방식은 레이아웃 분석, 콘텐츠 인식, 페이지 병합 등 여러 단계가 분리되어 있어 효율성이 낮고, 한 단계의 오류가 후속 단계로 전파되는 한계가 있다. 반면, 기존의 End-to-End 방법론은 배포가 간편함에도 불구하고 주류 벤치마크에서 파이프라인 방식보다 성능이 저조하다는 문제가 있었다. 이에 저자들은 Qwen3.5-0.8B를 기반으로 한 경량 모델을 통해, 성능과 효율을 모두 잡는 강력한 End-to-End 파서를 구축하고자 하였다 [Figure 1].

Figure 1 — OmniDocBench v1.6 성능 비교
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 데이터 품질 확보와 고도화된 학습 레시피를 결합하여 OvisOCR2를 성공적으로 구현하였다. 먼저 Data Engine을 통해 실제 문서와 합성 데이터를 통합하여 다양한 레이아웃과 복잡한 구조에 대한 대응력을 높였다 [Figure 2]. 학습 과정은 Supervised Fine-tuning(SFT)을 거쳐 기초 정책을 수립한 뒤, Reinforcement Learning(RL)을 통해 텍스트, 수식, 표에 대한 구조적 보상을 극대화하였다 [Figure 3]. 이후 On-policy Distillation(OPD)을 적용하여 4B 모델의 강화학습 성능을 0.8B 모델로 효과적으로 전이시켰다. 실험 결과, OmniDocBench v1.6에서 96.58점의 State-of-the-art 성능을 기록하며, 기존 파이프라인 방식들을 상회하는 성과를 거두었다 [Table 2]. 또한, PureDocBench에서도 Avg3 점수 75.06을 달성하며 우수한 범용성과 강건성을 입증하였다.

Figure 3 — OvisOCR2의 2-branch 학습 구조
4. Conclusion & Impact (결론 및 시사점)
본 논문은 0.8B 수준의 경량 모델로도 고성능 End-to-End 문서 파싱이 가능함을 입증하였다. 이 연구는 복잡한 파이프라인 의존성을 제거함으로써 실무 환경에서의 문서 처리 효율을 극대화했다는 점에서 큰 의의가 있다. 향후 문서 파싱 기술이 단순 OCR을 넘어 구조적 이해가 필요한 AI 애플리케이션으로 확장되는 과정에서 OvisOCR2는 강력한 벤치마크 모델로 활용될 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
- [논문리뷰] HunyuanOCR Technical Report
- [논문리뷰] Understanding Reasoning from Pretraining to Post-Training
- [논문리뷰] On-Policy Delta Distillation
- [논문리뷰] Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
Review 의 다른글
- 이전글 [논문리뷰] MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- 현재글 : [논문리뷰] OvisOCR2 Technical Report
- 다음글 [논문리뷰] PalmClaw: A Native On-Device Agent Framework for Mobile Phones
댓글