본문으로 건너뛰기

[논문리뷰] GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

링크: 논문 PDF로 바로 열기

Part 1: 요약 본문

저자: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, et al.

1. Key Terms & Definitions (핵심 용어 및 정의)

  • CoAE (Control-Oriented Autoencoder): 로봇 조작 데이터의 압축 표현을 학습하기 위해 설계된 오토인코더로, 표준적인 시각적 재구성뿐만 아니라 다중 티처와의 feature alignment를 통해 제어에 최적화된 Latent Space를 생성합니다.
  • SVP (Single-Step Visual Planner): 여러 단계의 확산 과정 없이 단일 flow-generator pass를 통해 완전한 미래 상태를 예측하는 모델로, 시각적 계획과 Inverse Dynamics의 분리된 사전 학습을 가능하게 합니다.
  • IDM (Inverse Dynamics Model): 현재 상태와 예측된 미래 시각적 상태를 입력받아 로봇의 액션을 추론하는 모델로, 성공 여부가 명시되지 않은 데이터에서도 학습이 가능합니다.
  • KASO (Knowledge-Aligned Selective Optimization): IDM이 판단하기에 기록된 액션과 행동학적으로 호환되는 예측된 미래 상태만을 선택하여 co-training에 활용함으로써, 학습 과정에서의 supervision 불일치를 해결하는 기법입니다.
  • Validity Gap: 행동 생성 시 예측된 미래 시각적 상태가 실제 기록된 액션과 다른 모드(mode)의 행동을 묘사할 때 발생하는 감독(supervision) 불일치 문제를 의미합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 World-Action Models(WAM)가 주로 기학습된 비디오 생성기에 의존하며, 모델 전체의 사전 학습 및 확장성(scaling)에 대한 연구가 부족하다는 점을 해결하고자 합니다. 특히 로봇 조작 분야에서는 Visual-Language-Action(VLA) 정책이 널리 쓰이나, 물리적 동역학을 명시적으로 모델링하지 못한다는 한계가 있습니다. 기존의 WAM 방식들은 시각적 생성과 제어를 결합하는 과정에서 복잡한 다단계 생성 비용과 더불어, 기록된 데이터와 생성된 결과물 간의 불일치로 인해 성능 향상에 제약이 있었습니다. 저자들은 이러한 문제를 해결하기 위해 시스템 전체를 스크래치(from scratch)에서 사전 학습하는 GE-Act 2.0을 제안합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 CoAE, SVP, IDM으로 구성된 구조를 통해 Manipulation 데이터 전반에 걸친 확장성을 확보합니다. CoAE는 64×64 spatial downsampling을 통해 24개의 토큰만으로도 높은 정보 보존력을 보이며, 이는 DINOv3 대비 13-31%의 액션 복구 성능 차이를 유지하면서도 데이터 압축 효율을 극대화합니다. SVP는 단일 단계 생성 방식을 통해 비디오 생성기와 액션 모델의 분리 학습을 가능하게 하며, KASO를 도입하여 IDM과 행동학적으로 호환되는 미래 상태만을 선택함으로써 학습의 안정성을 높입니다. 실험 결과, 사전 학습 데이터 규모를 300시간에서 30,000시간으로 확장함에 따라 G1-OP 성능이 17.1%에서 44.1%로, G2-90D 성능이 13.4%에서 31.1%로 비약적으로 향상되었습니다. 또한, 별도의 Fine-tuning 없이도 90% 이상의 trials에서 정밀한 Instruction Following을 수행하며 OOD 환경에서의 강건한 일반화 성능을 증명했습니다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 로봇 조작을 위한 월드 액션 모델을 스크래치에서 사전 학습하고 성공적으로 확장할 수 있음을 입증했습니다. 제안된 GE-Act 2.0은 시각적 계획과 Inverse Dynamics 간의 유기적인 결합을 통해 데이터 활용도를 높이고, 특히 KASO 기법을 통해 학습 데이터 간의 질적 불일치를 효과적으로 제어합니다. 이 연구는 범용적인 로봇 학습 모델 구축에 있어 효율적인 시각적 표상과 데이터 스케일링의 방향성을 제시하며, 학계와 산업계 전반에 걸쳐 데이터 효율적이고 강건한 로봇 정책 학습 프레임워크의 토대를 마련했다는 평가를 받습니다.

Figure 1: GE-Act 2.0 전체 아키텍처

Figure 1 — GE-Act 2.0 전체 아키텍처

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글