[논문리뷰] TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation
링크: 논문 PDF로 바로 열기
메타데이터
저자: Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun
1. Key Terms & Definitions (핵심 용어 및 정의)
- Real2Sim: 실제 환경의 이미지 데이터를 시뮬레이션 환경으로 변환하는 파이프라인으로, 본 논문에서는 인터넷 미디어를 기반으로 고충실도 디지털 트윈을 구축하는 과정을 지칭함.
- LCCR (Layout-Consistent Collision Rectification): 초기 3D 재구성 모델에서 발생하는 메쉬 간의 중첩(Interpenetration)을 해결하기 위한 기하학적 최적화 모듈로, 공간적 배치를 보존하면서 물리적 안정성을 확보하는 핵심 기법임.
- TableVerse-100K Dataset: 100,000개의 physically consistent한 tabletop 환경과 expert manipulation 궤적을 포함하는 대규모 데이터셋임.
- MJCF (MuJoCo XML): MuJoCo 물리 엔진에서 시뮬레이션 가능한 객체와 환경 설정을 정의하는 파일 포맷으로, 본 논문에서 재구성된 환경을 저장하는 표준 형식임.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 일반화 가능한 로봇 조작 정책 학습에 필수적인 대규모 고충실도 시뮬레이션 데이터의 부족 문제를 해결하고자 한다. 기존의 자동화된 시뮬레이션 생성 방식은 텍스트 기반의 단순화된 배치나 가상 데이터에 의존하여 실제 인간 환경의 복잡한 클러터(clutter)와 빽빽한 배치를 재현하지 못하는 한계가 있다. 이러한 방식은 물리적으로 불가능한 충돌을 빈번하게 발생시켜 시뮬레이션의 신뢰성을 저하시킨다. 저자들은 실제 인터넷 데이터를 결정론적으로 재구성하여 물리적으로 타당한 고품질 데이터셋을 구축할 필요성을 강조한다 [Figure 1].

Figure 1 — TableVerse-100K 데이터셋 통계
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 단일 뷰 이미지로부터 Real2Sim 환경을 자동 생성하는 TableVerse 파이프라인을 제안한다. 해당 프로세스는 open-vocabulary 객체 탐지, 복합 객체 분해, 그리고 LCCR을 통한 물리적 안정화 단계를 거쳐 구축된다 [Figure 2]. 특히 LCCR은 3단계(hierarchical grouping, radial graph construction, vertical disentanglement) 최적화를 통해 메쉬 간의 기하학적 충돌을 완벽히 제거한다 [Figure 4]. 또한, Gemini 2.5 Pro를 활용한 MLLM 기반의 데이터 큐레이션 파이프라인을 통해 물리적 타당성과 태스크 적합성을 검증한 TableVerse-100K를 생성하였다 [Figure 5]. 실험 결과, TableVerse는 기존 방법론인 MIDI, SAM3D, SceneMaker 대비 Scene Collision Rate에서 0.0%라는 압도적인 성능을 기록하였다. 또한, Layout Fidelity(7.14), Visual Quality(7.08), Geometry Quality(7.03) 측면에서도 비교 대상들을 크게 상회하는 우수한 지표를 달성하였다 [Table 1].

Figure 2 — TableVerse 파이프라인 개요

Figure 4 — LCCR 모듈 상세 구조
4. Conclusion & Impact (결론 및 시사점)
본 연구는 실제 환경의 복잡성을 그대로 담은 대규모 Real2Sim 데이터셋을 구축함으로써 로봇 조작 연구의 데이터 장벽을 해소하는 혁신적인 토대를 마련하였다. TableVerse 파이프라인은 복잡한 실제 데이터를 로봇이 학습 가능한 물리적 자산으로 자동 변환하는 체계적인 방법론을 제시한다. 이러한 기여는 향후 다양한 환경에서 범용적으로 작동하는 로봇 조작 정책(generalizable manipulation policies) 개발을 가속화하고, 시뮬레이션 대 실제 환경 간의 격차(sim-to-real gap)를 줄이는 데 중요한 이정표가 될 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
- [논문리뷰] SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation
- [논문리뷰] StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization
- [논문리뷰] ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- [논문리뷰] WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
Review 의 다른글
- 이전글 [논문리뷰] Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
- 현재글 : [논문리뷰] TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation
- 다음글 [논문리뷰] Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
댓글