[논문리뷰] Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model본 논문은 기존 VLM들이 오프라인 추론에서는 우수한 성능을 보이나, 연속적인 비디오 스트림 처리 시 발생하는 Moravec’s paradox를 해결하고자 합니다. 기존 연구들은 고정된 프레임 샘플링 방식을 사용하여 배경과 같은 중복 정보를 반복적으로 인코딩함으로써 컴퓨팅 효율성을 저하시키고 실시간 반응성을 제한합니다.#Review#Multimodal Foundation Model#Codec-Native#Streaming Perception#Video-Language Model#Visual Tokenization#Efficiency#AI4AI Data Pipeline2026년 7월 28일댓글 수 로딩 중
[논문리뷰] VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding본 논문은 기존 Video MLLM이 겪는 일반화 부족, 높은 연산 비용, 그리고 폐쇄적인 연구 생태계라는 세 가지 한계를 해결하는 것을 목표로 한다. 기존 모델들은 짧은 영상에는 강점을 보이지만, 장시간 영상이나 실시간 스트리밍 환경으로의 확장이 어렵고 연산량이 기하급수적으로 증가하는 문제를 안고 있다.#Review#Video MLLM#I3D-ViT#Adaptive Frame Resolution#Video Understanding#Open Source#Streaming Perception2026년 7월 16일댓글 수 로딩 중
[논문리뷰] InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams본 논문은 실시간 스트리밍 환경에서 3D 시각 기하학 이해 가 확장성과 장기적 안정성이라는 상충되는 요구사항으로 인해 제한되는 문제를 해결하고자 합니다.#Review#3D Reconstruction#Transformer#Streaming Perception#Memory Management#KV Cache Pruning#Visual Geometry#Temporal Consistency#Continuous Learning2026년 1월 5일댓글 수 로딩 중