[논문리뷰] Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model본 논문은 기존 VLM들이 오프라인 추론에서는 우수한 성능을 보이나, 연속적인 비디오 스트림 처리 시 발생하는 Moravec’s paradox를 해결하고자 합니다. 기존 연구들은 고정된 프레임 샘플링 방식을 사용하여 배경과 같은 중복 정보를 반복적으로 인코딩함으로써 컴퓨팅 효율성을 저하시키고 실시간 반응성을 제한합니다.#Review#Multimodal Foundation Model#Codec-Native#Streaming Perception#Video-Language Model#Visual Tokenization#Efficiency#AI4AI Data Pipeline2026년 7월 28일댓글 수 로딩 중
[논문리뷰] ProfVLM: A Lightweight Video-Language Model for Multi-View Proficiency Estimation본 논문은 기존의 블랙박스 비디오 분류기가 다중 시점(multi-view) 컨텍스트를 무시하고 설명 가능성이 부족하다는 문제점을 해결하고자 합니다.#Review#Video-Language Model#Proficiency Estimation#Multi-View Video#Action Quality Assessment#Lightweight Model#Generative Feedback2025년 10월 1일댓글 수 로딩 중