본문으로 건너뛰기

[논문리뷰] Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

링크: 논문 PDF로 바로 열기

저자: Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • VLA (Vision-Language-Action) Model: 시각적 관측값과 언어 지시사항을 입력받아 로봇의 동작(Action)을 생성하는 모델입니다.
  • UMI (Universal Manipulation Interface): 핸드헬드 그리퍼와 에고센트릭 카메라를 통해 대규모로 조작 데이터를 수집하는 인터페이스입니다.
  • Flow Matching: 복잡한 데이터 분포를 생성하기 위해 확률 경로를 학습하는 기법으로, DiT(Diffusion Transformer) 기반의 action generation에 사용됩니다.
  • MoT (Mixture-of-Transformers): VLM과 DiT를 결합한 아키텍처로, VLM은 특징 추출을 담당하고 DiT는 flow matching을 통해 동작을 생성합니다.
  • Choice Policies: VLM 프레임워크 내에서 직접 후보 동작을 생성하고 점수를 매겨 학습 수렴을 가속화하는 기법입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 대규모 데이터 학습을 통해 범용 로봇 정책을 구축하고자 하는 Scaling Laws의 가능성을 실현하는 데 초점을 맞춥니다. 기존의 로봇 학습은 teleoperation의 비용과 낮은 확장성으로 인해 데이터 수집에 병목이 존재하며, 특정 작업이나 환경에 편향된 데이터셋으로 인해 일반화 성능이 제한되는 문제가 있습니다. 저자들은 이러한 데이터 한계를 극복하기 위해 100K 시간 이상의 실세계 조작 데이터를 활용한 대규모 학습 체계를 제안합니다. 이를 통해 unseen environments에서의 zero-shot 일반화 능력을 확보하고, downstream tasks에 대한 높은 데이터 효율성을 달성하고자 합니다 [Figure 1].

Figure 1: 모델 개요

Figure 1 — 모델 개요

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Pre-training과 Post-training으로 구성된 2단계 학습 체계(Two-stage training recipe)를 제안합니다. Pre-training 단계에서는 UMI를 통해 수집된 100K 시간의 데이터를 대규모 자동 라벨링 파이프라인으로 처리하여, 모델이 scene state transitions을 이해하고 동작을 생성하도록 학습시킵니다. Post-training 단계에서는 cross-embodiment 데이터를 사용하여 UMI 기반의 동작 생성 능력을 실제 로봇 환경으로 전이(alignment)하고, 자연어 지시사항에 반응하도록 최적화합니다 [Figure 2, Figure 3].

실험 결과, Xiaomi-Robotics-1은 데이터 규모와 모델 크기가 커질수록 성능이 지속적으로 향상되는 강력한 Scaling behavior를 보였습니다. 특히 RoboCasa365 벤치마크에서 기존 최고 기록인 46.6%를 큰 폭으로 상회하는 57.6%의 Success Rate를 달성하였으며, RoboDojo 벤치마크에서도 평균 점수 20.07로 기존 방법론(13.07)을 압도하는 성능을 입증하였습니다 [Figure 8, Figure 10]. 또한, 새로운 작업 수행을 위한 fine-tuning 시, 평균 10시간 미만의 데이터만으로도 75%의 Success Rate를 기록하여 타 모델 대비 탁월한 데이터 효율성을 보여주었습니다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 대규모 실세계 조작 데이터를 활용하여 VLA 모델의 Scaling 가능성을 입증함으로써 로봇 기초 모델 연구의 새로운 이정표를 제시합니다. 제안된 자동 라벨링 파이프라인과 2단계 학습 방식은 향후 로봇 데이터 수집 및 학습의 표준이 될 가능성이 큽니다. 특히 unseen environments에서의 뛰어난 일반화 능력과 적은 데이터로 가능한 빠른 환경 적응력은, 로봇이 제한된 연구실 환경을 벗어나 실제 생활 공간으로 확장되는 데 핵심적인 기여를 할 것으로 기대됩니다.

Figure 2: 모델 아키텍처

Figure 2 — 모델 아키텍처

Figure 8: 정량적 성능 비교

Figure 8 — 정량적 성능 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글