[논문리뷰] DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes본 논문은 VLM의 사전 학습 데이터 구성을 직관에 의존하는 휴리스틱한 방식에서 재현 가능한 엔지니어링 원칙으로 전환하고자 한다. 기존 연구들은 단순히 고품질 데이터를 필터링하거나 데이터셋을 단순히 쌓는 방식을 사용하며, 데이터셋 추가가 성능에 미치는 인과 관계를 명확히 파악하기 어려운 문제가 있다.#Review#Vision-Language Models#Data Mixture Optimization#Convex Optimization#Dataset-Level Assessment#Scalable VLM Training#Attributable Validation2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-trainingLarge Language Model (LLM) 사전 학습에서 효과적인 데이터 혼합 비율을 결정하는 것은 여전히 어려운 문제입니다.#Review#LLM Pre-training#Data Mixture Optimization#Model Merging#Proxy Models#Resource Efficiency#DeMix#Corpus Curation2026년 2월 3일댓글 수 로딩 중
[논문리뷰] Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training본 논문은 텍스트 전용 사전 훈련을 통해 대규모 언어 모델(LLM)이 시각적 세계에 대해 습득하는 내재된 시각적 사전 지식(visual priors)의 구조와 기원 을 체계적으로 밝히는 것을 목표로 합니다.#Review#LLM Visual Priors#Language Pre-training#Multimodal LLM#Data Mixture Optimization#Reasoning Prior#Perception Prior#VQA#MLE-Bench2025년 10월 1일댓글 수 로딩 중