[논문리뷰] NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference본 논문은 기존 multimodal 모델들이 지나치게 복잡한 아키텍처를 사용하여 비효율적인 추론 및 fine-tuning 구조를 가진 문제를 해결하고자 합니다.#Review#Multimodal Encoder#Bidirectional Transformer#Visual Document Retrieval#Masked Discrete-Diffusion#Late-Interaction#Efficient Inference#Dynamic Resolution2026년 9월 2일댓글 수 로딩 중
[논문리뷰] ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution본 논문은 MLLM의 이미지 입력으로 인한 추론 비용 증가 문제를 해결하고, 이미지의 의미론적 복잡성 에 따라 가변적인 수의 시각 토큰을 사용하여 이미지를 효율적으로 표현하는 새로운 훈련 전략을 제안합니다.#Review#Multimodal Large Language Models (MLLMs)#Dynamic Resolution#Token Compression#Semantic Awareness#Visual Consistency Learning (ViCO)#Visual Resolution Router (ViR)#Inference Optimization2025년 10월 15일댓글 수 로딩 중