[논문리뷰] LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training대규모 오픈 비디오-언어 리소스는 텍스트 및 이미지 코퍼스에 비해 상대적으로 작다는 핵심적인 문제가 존재합니다. 기존의 가장 큰 비디오 데이터셋인 InternVid는 7백만 개의 비디오를 포함하지만, 이는 현대 텍스트 및 이미지 코퍼스와 비교하면 규모가 미미합니다.#Review#Multimodal Pre-training#Video Dataset#Audio Dataset#Image-Text Pairs#Scaling Laws#ViCLIP#CLAP#CLIP2026년 8월 25일댓글 수 로딩 중
[논문리뷰] MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models본 논문은 의료 AI 모델의 성능을 제한하는 핵심 원인인 대규모 고품질 의료 멀티모달 데이터의 부족 문제를 해결하고자 합니다.#Review#Multimodal Foundation Models#Medical Data Curation#PubMed Central#Image-Text Pairs#Vision-Language Models#Clinical Transfer Validation#High-Fidelity Pipeline2026년 7월 12일댓글 수 로딩 중