[논문리뷰] Data Pyramid for Embodied Manipulation본 논문은 Embodied AI 모델의 성능을 결정짓는 핵심 요소인 '데이터'가 매우 파편화되어 있다는 문제 의식에서 출발합니다. 기존 연구들은 특정 모델의 학습 레시피에 의존하여 데이터를 수집하거나, 아키텍처 중심의 평가에 치중하여 데이터 소스 간의 관계와 trade-off를 시스템화하지 못했습니다.#Review#Embodied AI#Foundation Models#Data Pyramid#Robotics#Manipulation#Multimodal Learning#Robot Learning2026년 7월 27일댓글 수 로딩 중
[논문리뷰] TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation본 논문은 일반화 가능한 로봇 조작 정책 학습에 필수적인 대규모 고충실도 시뮬레이션 데이터의 부족 문제를 해결하고자 한다. 기존의 자동화된 시뮬레이션 생성 방식은 텍스트 기반의 단순화된 배치나 가상 데이터에 의존하여 실제 인간 환경의 복잡한 클러터(clutter)와 빽빽한 배치를 재현하지 못하는 한계가 있다.#Review#Real2Sim#Manipulation#Scene Generation#Trajectory Generation#Robotic Manipulation2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning본 논문은 Embodied Intelligence 연구에 필요한 대규모 고품질 조작 데이터의 파편화 문제를 해결하고자 합니다. 기존 데이터셋은 고가의 장비나 특정 환경에 의존하여 확장성이 낮으며, 수집된 원시 비디오를 로봇 학습에 바로 사용할 수 있도록 가공하는 체계적인 인프라가 부족합니다.#Review#Embodied Learning#Egocentric Dataset#Manipulation#Toolchain#MANO#Vision-Language-Action#Robot Learning2026년 7월 20일댓글 수 로딩 중
[논문리뷰] See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models본 논문은 대규모 데이터셋을 활용하는 VLA 모델 학습 시, 카메라 뷰포인트 변화에 따른 성능 저하 문제를 해결하고자 합니다. 기존 모델들은 카메라 프레임의 RGB 데이터를 입력으로 사용하므로, 실제 로봇 동작이 정의되는 Robot-frame과의 Frame mismatch가 발생합니다 .#Review#VLA#Manipulation#3D Geometry#Pointmap#Robot-Centric#Viewpoint Variation#End-to-End Learning2026년 7월 19일댓글 수 로딩 중
[논문리뷰] RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies본 논문은 장기적이고 이력 의존적인 로봇 조작 태스크에서 메모리 기반의 Vision-Language-Action (VLA) 모델 의 체계적인 평가 및 발전을 위한 표준화된 벤치마크를 구축하는 것을 목표로 합니다. 기존 메모리 메커니즘 평가의 비표준화된 환경과 제한적인 이해를 개선하고자 합니다.#Review#Robotics#Memory#Benchmark#Manipulation#Vision-Language-Action Models#Temporal Memory#Spatial Memory#Procedural Memory2026년 3월 8일댓글 수 로딩 중
[논문리뷰] TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics본 논문은 로봇 공학 분야의 주요 병목 현상인 보상 모델링 문제를 해결하기 위해, 사전 훈련된 Vision-Language Models (VLMs) 의 내부 토큰 확률 을 활용하여 제로-샷(zero-shot) 진척도(progress) 추정 을 가능하게 하는 것을 목표로 합니다.#Review#Robotics#Reward Modeling#Vision-Language Models#Zero-Shot Learning#Token Probabilities#Progress Estimation#Behavior Cloning#Manipulation2026년 2월 23일댓글 수 로딩 중
[논문리뷰] RoboBrain 2.5: Depth in Sight, Time in Mind본 논문은 기존 embodied AI foundation model의 2D pixel 기반 grounding 및 sparse temporal supervision의 한계를 극복하고, 정확한 3D 공간 추론(Precise 3D Spatial Reasoning) 과 밀집 시간 가치 예측(Dense Temporal Value Estimation) 능력을 통해 로봇의 물리적 상호작용 신뢰성과 실행 인지도를 향상시키는 것을 목표로…#Review#Embodied AI#Foundation Model#3D Spatial Reasoning#Temporal Value Estimation#Robotics#Manipulation#Multimodal Learning2026년 1월 21일댓글 수 로딩 중
[논문리뷰] Video models are zero-shot learners and reasoners본 논문은 비디오 모델이 대규모 언어 모델(LLM)이 언어 이해 분야에서 이룬 것과 같이, 일반적인 목적의 비전 파운데이션 모델이 될 수 있다는 가설을 제시합니다.#Review#Video Models#Zero-shot Learning#Visual Reasoning#Foundation Models#Generative AI#Perception#Manipulation#Modeling2025년 9월 25일댓글 수 로딩 중
[논문리뷰] Towards Affordance-Aware Robotic Dexterous Grasping with Human-like Priors이 논문은 로봇의 능숙한 파지(dexterous grasping) 시 기존 연구들이 간과했던 어포던스 인식(affordance-aware) 위치 설정 및 인간과 유사한 자세 의 중요성에 주목합니다.#Review#Robotic Dexterous Grasping#Affordance-Aware#Human-like Priors#Reinforcement Learning#Vision-Language Models#Two-Stage Training#Manipulation2025년 8월 13일댓글 수 로딩 중