[논문리뷰] On the Design Fundamentals of Pixel Text Representation Learning본 논문은 기존 Pixel-based Text Encoder가 고정된 해상도 Pretraining, Visual Shortcut Learning, 취약한 Multimodal Grounding, 그리고 Multilingual Visual Text Understanding 측면에서 겪는 근본적인 문제들을 해결하고자 합니다.#Review#Pixel Text Representation Learning#Vision-Language Models#Multimodal Grounding#Native-Resolution Encoding#Layout Augmentation#Multilingual Text Understanding#Contrastive Learning#Optical Context Compression2026년 9월 2일댓글 수 로딩 중