[논문리뷰] See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models본 논문은 대규모 데이터셋을 활용하는 VLA 모델 학습 시, 카메라 뷰포인트 변화에 따른 성능 저하 문제를 해결하고자 합니다. 기존 모델들은 카메라 프레임의 RGB 데이터를 입력으로 사용하므로, 실제 로봇 동작이 정의되는 Robot-frame과의 Frame mismatch가 발생합니다 .#Review#VLA#Manipulation#3D Geometry#Pointmap#Robot-Centric#Viewpoint Variation#End-to-End Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] Geometric Action Model for Robot Policy Learning본 논문은 기존의 Vision-Language-Action Models (VLAs)가 2D 기반의 시각적 지식에 의존하여 3D 물리적 조작 환경에서 깊이, 스케일, 폐색(occlusion)을 명시적으로 추론하지 못하는 한계를 해결하고자 합니다.#Review#Robot Policy Learning#Geometric Foundation Model#Vision-Language-Action Model#World Model#Causal Future Prediction#3D Geometry2026년 6월 15일댓글 수 로딩 중
[논문리뷰] Unlocking Dense Metric Depth Estimation in VLMs본 논문은 기존 VLMs가 2D 과업에는 뛰어나지만 3D 이해 능력은 여전히 제한적이라는 핵심 문제에서 출발합니다 . 기존 연구들은 외부의 3D 전문 모델로부터 지식을 증류하거나, 텍스트 기반으로만 학습하여 정밀한 기하학적 정보가 부족하고 오류가 누적되는 한계를 보입니다.#Review#Vision-Language Models#Dense Metric Depth Estimation#3D Geometry#Unified Supervision#Spatial Reasoning2026년 5월 17일댓글 수 로딩 중