본문으로 건너뛰기

[논문리뷰] TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

링크: 논문 PDF로 바로 열기

메타데이터

저자: Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding


1. Key Terms & Definitions (핵심 용어 및 정의)

  • VLA (Vision-Language-Action) Model: 시각적 관측치(Visual Observation), 자연어 지시어(Natural-Language Instruction), 로봇 액션(Robot Action)을 통합하여 로봇 제어를 수행하는 모델입니다.
  • LLM-centric VLA: 대규모 언어 모델을 핵심 인터페이스로 사용하여, 모든 입력 데이터를 언어 모델의 표현 공간으로 투영한 뒤 액션을 생성하는 전통적인 VLA 구조입니다.
  • Continuous Action Chunking: 모델이 한 번의 Forward Pass를 통해 여러 단계의 연속적인 로봇 액션 시퀀스를 예측함으로써 효율성을 높이는 기법입니다.
  • Direct Vision-Language Interaction: 거대 언어 모델을 거치지 않고, Visual feature와 Language feature를 직접적인 Cross-attention 모듈로 결합하여 제어 정보를 생성하는 방식입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 LLM-centric VLA 모델이 가진 방대한 연산량과 메모리 오버헤드가 실시간 로봇 제어의 병목 현상을 유발한다는 문제를 해결하고자 합니다. 기존 모델들은 시각 정보를 언어 모델의 토큰 공간으로 변환하고 이를 다시 액션으로 변환하는 V→L→A 경로를 따르며, 이는 모델 규모가 클수록 추론 지연(Inference Latency)을 극대화합니다 [Figure 2]. 따라서 연구진은 실행 단계의 로봇 제어에 반드시 거대 언어 모델이 중심이 될 필요는 없다는 점에 주목하였습니다. 결과적으로, LLM의 복잡한 추론 능력 대신 시각-언어 간 직접적인 상호작용을 통해 효율성을 극대화한 새로운 VLA 패러다임이 요구됩니다.

Figure 2: LLM-centric 모델 대비 구조 비교

Figure 2 — LLM-centric 모델 대비 구조 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 대규모 모델 없이도 실시간 제어가 가능한 TurboVLA를 제안합니다. TurboVLAVision Encoder와 경량화된 Text Encoder를 사용하여 입력 데이터를 개별적으로 처리하며, 이후 Bidirectional Vision-Language Interaction 모듈을 통해 두 모달리티의 정보를 직접 결합합니다 [Figure 3]. 이 과정에서 생성된 태스크 조건부 표현은 ACT-style Action Chunk Decoder를 통해 추가적인 토큰화 과정 없이 연속적인 액션 청크로 즉시 변환됩니다. 이러한 설계는 모델의 복잡성을 대폭 낮추어 0.2B 파라미터 규모만으로도 강력한 성능을 발휘합니다. LIBERO 벤치마크 실험 결과, TurboVLA는 평균 97.7%의 높은 성공률을 달성했습니다 [Table 1]. 또한, 소비자용 RTX 4090 GPU 환경에서 31.2 ms의 매우 짧은 End-to-End Latency를 기록하며 초당 32 Hz 이상의 제어 주기를 구현하였고, 모델 구동을 위한 VRAM 사용량 또한 0.9 GB 미만으로 최적화되었습니다.

Figure 3: TurboVLA 전체 아키텍처

Figure 3 — TurboVLA 전체 아키텍처

4. Conclusion & Impact (결론 및 시사점)

본 논문은 실행 중심의 로봇 제어에서 거대 언어 모델의 역할을 재정의하고, TurboVLA를 통해 효율적인 V+L→A 아키텍처의 가능성을 입증하였습니다. 이 연구는 기존 LLM-centric 모델에 의존하던 로봇 정책 학습 방식을 탈피하여, 자원 제약이 있는 로봇 하드웨어에서도 실시간 제어가 가능함을 보여주었습니다. 결과적으로 TurboVLA는 성능과 효율성 사이의 유리한 트레이드오프를 제공함으로써, 향후 실시간성을 요구하는 다양한 로봇 조작 작업(Robotic Manipulation)의 상용화 및 현장 배치에 중대한 기술적 이정표를 제시합니다.

Figure 1: TurboVLA의 효율적 성능 지표

Figure 1 — TurboVLA의 효율적 성능 지표

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글