[논문리뷰] Generative Late-Interaction Embeddings For Visual Document Retrieval본 논문은 Late-Interaction 모델이 고성능을 제공하지만, 페이지당 수천 개의 벡터를 저장해야 하는 과도한 저장 공간(Storage) 문제를 해결하고자 합니다. 기존의 압축 방식(Token pooling, Pruning)은 성능 저하가 크거나 모델을 재학습(Retraining)해야 한다는 한계가 있습니다.#Review#Late-Interaction#Visual Document Retrieval#Generative Embeddings#Manifold Learning#Spherical Anchoring#MaxSim#Compression2026년 9월 10일댓글 수 로딩 중
[논문리뷰] NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference본 논문은 기존 multimodal 모델들이 지나치게 복잡한 아키텍처를 사용하여 비효율적인 추론 및 fine-tuning 구조를 가진 문제를 해결하고자 합니다.#Review#Multimodal Encoder#Bidirectional Transformer#Visual Document Retrieval#Masked Discrete-Diffusion#Late-Interaction#Efficient Inference#Dynamic Resolution2026년 9월 2일댓글 수 로딩 중
[논문리뷰] ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval본 논문은 시각적 문서 검색에서 쿼리와 문서 간의 미세한 연관성을 포착하는 데 기존 방식이 가진 한계를 해결하고자 한다 .#Review#Visual Document Retrieval#Representation Learning#Vision-Language Models#Latent Concept Learning#Multimodal Retrieval-Augmented Generation2026년 8월 17일댓글 수 로딩 중
[논문리뷰] DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation본 논문은 기존의 고성능 VDR 시스템이 요구하는 막대한 컴퓨팅 자원과 인덱싱 비용 문제를 해결하고자 합니다. 현재 최첨단 VDR 모델들은 수십억 개의 파라미터를 사용하며, Multi-vector 기반의 복잡한 연산으로 인해 메모리 사용량과 검색 레이턴시가 지나치게 높습니다.#Review#Visual Document Retrieval#Distillation#Single-Vector#End-to-End#Multimodal#Encoder-only2026년 8월 11일댓글 수 로딩 중