[논문리뷰] EchoWM: Open and Enterable Omnimodal World Models본 논문은 기존의 생성형 모델들이 프롬프트 기반의 수동적인 방식에 머물러 있어, 사용자가 환경을 직접 탐험하고 상호작용하는 ‘Enterable’한 경험을 제공하지 못하는 문제를 해결하고자 합니다.#Review#World Models#Omnimodal Generation#Camera-Intent Conditioning#6-DoF Trajectory#Progressive Training#Audio-Visual Synchronization2026년 8월 24일댓글 수 로딩 중
[논문리뷰] ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation본 논문은 기존 통합 멀티모달 모델(UMM) 평가 방식이 텍스트 및 이미지 이해/생성 능력을 개별적으로 측정하여 모달리티 간 상호 추론 능력 을 간과하는 문제를 제기합니다.#Review#Multimodal AI#Benchmarking#Cross-Modal Reasoning#Omnimodal Generation#Visual Generation#Verbal Generation#Unified Multimodal Models2025년 11월 9일댓글 수 로딩 중