[논문리뷰] Masked Visual Actions for Unified World Modeling본 논문은 로봇의 동작을 비디오 생성 모델이 이해할 수 있는 범용적인 시각적 언어로 통일하여, 하나의 모델로 forward 및 inverse 추론을 동시에 수행하는 문제를 해결합니다.#Review#World Modeling#Video Generation#Robotic Manipulation#Masked Visual Actions#Embodiment-agnostic#Inverse Dynamics2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs본 논문은 현재 VLA 학습이 겪고 있는 데이터 부족 문제를 해결하기 위해, 대규모 Expert Demonstration 의존성을 탈피하는 새로운 사전 학습 프레임워크를 제안합니다. 기존의 VLA 모델은 고가의 인간 조작 데이터에 과도하게 의존하며, 이는 데이터 수집의 확장성을 저해하는 근본적인 병목 현상으로 작용합니다.#Review#Vision-Language-Action Models#Task-Agnostic Pretraining#Embodied AI#Inverse Dynamics#Physical Grounding#Robotic Manipulation2026년 7월 2일댓글 수 로딩 중
[논문리뷰] VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos본 연구는 GUI(Graphical User Interface) 에이전트 훈련에 필요한 대규모의 수동 주석된 상호작용 데이터 확보의 어려움을 해결하고자 합니다.#Review#GUI Agents#Video Pretraining#Inverse Dynamics#Action Recognition#Computer Use Automation#Data Synthesis#Multimodal Learning2025년 10월 23일댓글 수 로딩 중