[논문리뷰] LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training대규모 오픈 비디오-언어 리소스는 텍스트 및 이미지 코퍼스에 비해 상대적으로 작다는 핵심적인 문제가 존재합니다. 기존의 가장 큰 비디오 데이터셋인 InternVid는 7백만 개의 비디오를 포함하지만, 이는 현대 텍스트 및 이미지 코퍼스와 비교하면 규모가 미미합니다.#Review#Multimodal Pre-training#Video Dataset#Audio Dataset#Image-Text Pairs#Scaling Laws#ViCLIP#CLAP#CLIP2026년 8월 25일댓글 수 로딩 중