[논문리뷰] Douyin Multimodal Embedding Model Technical Report본 논문은 대규모 산업용 다중 모달 플랫폼에서 효율적인 검색과 세밀한 의미론적 식별이라는 두 가지 상충하는 요구사항을 동시에 만족시키기 위해 DME를 제안합니다.#Review#Multimodal Embedding#Retrieval#Semantic Sufficiency#Latent Reasoning#Cross-Conditional Reconstruction#Bi-Encoder#Representation Learning2026년 8월 9일댓글 수 로딩 중
[논문리뷰] UEmbed: Unified Sparse and Dense Multimodal Embeddings본 연구는 기존 LSR 기법들이 인코더 기반의 양방향 아키텍처에 종속되어 있어 최신 Decoder-only 모델의 효율성을 활용하기 어렵다는 문제점을 해결하고자 합니다. 기존 멀티모달 검색 모델들은 별도의 보조 교차 모달(Cross-modal) 모듈을 사용해야 하므로 모델의 확장성과 배포 효율성이 낮다는 한계가 있습니다.#Review#Multimodal Embedding#Learned Sparse Retrieval#Decoder-only Model#Causal Attention#Retrieval-Augmented Generation#Agentic Search2026년 8월 3일댓글 수 로딩 중
[논문리뷰] MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control본 논문은 멀티모달 임베딩 학습에서 생성형 추론(Chain-of-Thought)을 통합할 때 발생하는 구조적 불일치와 비효율성 문제를 해결한다.#Review#Multimodal Embedding#Large Language Models#Chain-of-Thought#Reinforcement Learning#Latent Variable#Causal Inference2026년 4월 7일댓글 수 로딩 중
[논문리뷰] Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum기존 비디오 리트리벌 패러다임이 좁은 벤치마크, 제한된 데이터, 단일 태스크 훈련으로 인해 일반화 능력이 저해되는 문제를 해결하는 것입니다. 이 연구는 다차원 진단 평가 를 통해 범용 비디오 임베딩 의 진정한 일반화 능력을 정의하고 달성하는 것을 목표로 합니다.#Review#Video Retrieval#Multimodal Embedding#Data Synthesis#Curriculum Learning#Zero-shot Generalization#Benchmark Design#MLLM#Video-Text Retrieval2025년 11월 9일댓글 수 로딩 중