[논문리뷰] GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?본 논문은 기존의 Vision-Language Models(VLMs)이 단일 또는 소수의 이미지 기반 공간 인지 과제에는 능숙하나, 복잡한 비디오 환경에서 요구되는 '글로벌 공간 인지' 능력이 현저히 부족하다는 문제 의식에서 출발한다 .#Review#GST-Bench#Global Spatial Awareness#Video-Language Models#Embodied AI#Spatial Reasoning#VQA2026년 8월 6일댓글 수 로딩 중