[논문리뷰] RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
링크: 논문 PDF로 바로 열기
메타데이터
저자: Kehan Li, Bohan Hou, Minghao Zhu, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- RynnBrain-VLA: 시각적 이해와 로봇의 신체적 제어를 통합하기 위해 개발된 Vision-Language-Action 모델 프레임워크입니다 [Figure 1].
- Contact-point Prediction: 그리퍼(gripper)의 중심점과 회전 각도를 예측하여 로봇의 잡기 동작 정밀도를 높이는 사전 학습 태스크입니다.
- Unified Cross-Embodiment Action Space: 서로 다른 로봇 형태(embodiment)의 동작을 하나의 공유된 고차원 공간에 매핑하고, 각 로봇에 맞게 마스킹(masking)을 적용하여 공동 학습을 가능하게 하는 구조입니다 [Figure 3].
- Real-Time Chunking (RTC): 로봇 제어의 지연 시간을 최소화하고 부드러운 동작을 수행하기 위해 사용되는 기술입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 범용적인 멀티모달 모델이 실제 물리적 환경에서 로봇 제어로 전이될 때 발생하는 Embodied Foundation Model의 한계점을 해결하고자 합니다. 기존 연구(RynnBrain 1.0)는 egocentric 이해와 공간적 추론에서 성과를 거두었으나, 로봇 조작에 필수적인 3D 공간에 대한 직접적인 이해와 구체적인 잡기(grasping) 지점 예측 능력이 부족했습니다. 또한, 각기 다른 구조를 가진 로봇들 사이의 동작 공간(action space) 불일치 문제는 단일 정책으로 여러 로봇을 제어하는 것을 어렵게 했습니다. 이를 극복하기 위해 저자들은 물리적 기반이 더 강화된 새로운 모델 아키텍처와 통합 학습 전략을 제안합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
저자들은 RynnBrain 1.1의 사전 학습에 Contact-point Prediction과 3D Grounding 태스크를 도입하여 로봇 조작에 최적화된 표현 학습을 수행했습니다 [Figure 2]. 3D Grounding을 위해 카메라 파라미터를 활용한 9차원 파라미터(위치, 크기, 방향) 예측을 수행하며, 이를 통해 정밀한 물리 공간 인식을 확보했습니다. 동작 제어 측면에서는 Unified Cross-Embodiment Action Space를 통해 서로 다른 로봇 플랫폼(Unitree G1, Astribot-S1, Tianji-Wuji)의 데이터를 하나의 모델에서 공동으로 학습시켰습니다 [Figure 3]. 성능 평가 결과, 122B-A10B 모델은 VSI-Bench, MMSI, RefSpatial-Bench 등 주요 벤치마크에서 기존 proprietary 및 open-source 모델을 모두 능가하는 우수한 성능을 입증했습니다. 특히, 제안된 통합 학습 방식은 별도의 개별 태스크 fine-tuning 대비 프로세스 점수와 성공률(success rate)을 유의미하게 향상시켰습니다.
4. Conclusion & Impact (결론 및 시사점)
본 연구는 RynnBrain 1.1을 통해 다양한 규모의 Embodied Foundation Model이 실세계 로봇 조작으로 성공적으로 확장될 수 있음을 증명했습니다. 특히 3D grounding과 contact-point prediction의 도입은 멀티모달 모델이 단순한 시각적 인식을 넘어 물리적 환경과 상호작용하는 능력을 갖추게 했음을 보여줍니다. 이번 연구에서 정립한 통합 동작 공간 전략은 향후 다양한 이기종 로봇을 단일 모델로 제어하는 일반화된 로봇 지능 개발에 중요한 기틀을 마련할 것으로 기대됩니다.
Part 2: 중요 Figure 정보

Figure 1 — RynnBrain 1.1 모델 패밀리 개요

Figure 2 — RynnBrain 1.1 아키텍처

Figure 3 — RynnBrain-VLA 구조 및 통합 동작 공간
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] ABot-N1: Toward a General Visual Language Navigation Foundation Model
- [논문리뷰] HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
- [논문리뷰] Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
- [논문리뷰] FrameSkip: Learning from Fewer but More Informative Frames in VLA Training
- [논문리뷰] ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning
Review 의 다른글
- 이전글 [논문리뷰] ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
- 현재글 : [논문리뷰] RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
- 다음글 [논문리뷰] SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
댓글