[논문리뷰] PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models현재 Vision-Language Models (VLM)은 시각적 이해와 Semantic 지식, Instruction Following에 강점을 보이지만, Physical Loop 내에서의 embodied understanding, action generation, future-state prediction과 같은 물리적 상호작용 능력은 부족합니다.#Review#Vision-Language Models#Embodied AI#Physical Foundation Models#Action Generation#Future-State Prediction#Autoregressive Models#Multimodal Learning2026년 9월 14일댓글 수 로딩 중