[논문리뷰] DataComp-VLM: Improved Open Datasets for Vision-Language Models본 논문은 현대의 Autoregressive VLM 학습에서 데이터 큐레이션 전략이 모델 성능을 결정짓는 핵심 요소임에도 불구하고, 이에 대한 표준화된 벤치마크가 부족하다는 점을 해결하고자 합니다.#Review#Vision-Language Models#Data Curation#Benchmark#Instruction-Tuning#Data Mixing#Scaling Laws#Pretraining2026년 7월 5일댓글 수 로딩 중
[논문리뷰] Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks본 논문은 기존 임베딩 모델의 불투명한 훈련 데이터 및 방법론 문제를 해결하고자, 다국어 및 교차 언어 태스크에서 최첨단 성능을 달성하는 완전 오픈 소스 범용 텍스트 임베딩 모델인 llama-embed-nemotron-8b 를 개발하는 것을 목표로 합니다.#Review#Text Embedding#Multilingual#Cross-Lingual#Contrastive Learning#Model Merging#Synthetic Data Generation#Instruction-Tuning#LLM2025년 11월 10일댓글 수 로딩 중