[논문리뷰] RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
링크: 논문 PDF로 바로 열기
메타데이터
저자: Dongchi Huang, Hongyin Zhang, Bohan Hou, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Temporal Distance: 관찰된 시점부터 작업 완료(completion cutoff)까지의 잔여 시간(cost-to-go)을 의미하며, 이를 통해 환경 내에서 작업의 진행도를 직관적으로 평가합니다.
- RynnValue: 로봇 조작을 위한 Value Foundation Model로, preference나 별도의 progress label 없이 Temporal Distance를 학습 목표로 하여 다양한 데이터셋을 통합합니다.
- Value-isolation Attention: 각 Observation에 대응하는 value query group이 다른 시점의 query와 간섭하지 못하도록 차단하여, 모델이 시퀀스 위치 등 비본질적인 shortcut을 학습하는 것을 방지하는 아키텍처 기법입니다.
- Symlog Binning: Temporal distance의 넓은 동적 범위를 효과적으로 다루기 위해 사용하는 데이터 표현 방식이며, distributional head를 통해 안정적인 회귀(regression)를 수행합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 로봇 학습에서 보상 체계(Reward Supervision)의 불투명성과 낮은 일반화 성능 문제를 해결하기 위해 Temporal Distance 기반의 새로운 가치 평가 프레임워크를 제안합니다 [Figure 1]. 기존 연구들은 작업 내부의 선호도(preference)나 정규화된 진행도(normalized progress)에 의존하는데, 이는 서로 다른 로봇 플랫폼과 작업 환경 간에 일관된 가치를 전달하기 어렵다는 한계가 있습니다. 특히 단순한 진행도 측정은 목표 지향적인 비용(cost-to-go)을 충분히 반영하지 못하여 장기적인 작업 수행 시 성능이 저하되는 원인이 됩니다. 저자들은 데이터셋의 타임스탬프를 활용하여 라벨링 비용을 최소화하면서도, 이질적인(heterogeneous) 로봇 데이터 전반에 걸쳐 재사용 가능한 보상 인터페이스가 필요함을 지적합니다.

Figure 1 — RynnValue 전체 아키텍처
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Temporal Distance를 학습 목표로 하는 RynnValue 프레임워크를 제안하며, 이를 통해 7,000시간 이상의 데이터에서 성공적인 학습을 수행합니다 [Figure 1]. 제안하는 방법론은 시점 간의 상관관계를 끊고 시각적 증거에 집중하도록 하는 Random Temporal Sampling과 Temporal-order Shuffling을 포함합니다. 또한, 절대적 시간 거리와 상대적 변위(relative temporal displacement)를 동시에 예측하는 듀얼 분포 헤드(dual distributional heads)를 사용하며, 모델의 예측이 외부 shortcut에 오염되지 않도록 Value-isolation Attention을 적용합니다 [Figure 2]. 실험 결과, RynnValue-8B 모델은 Preference 라벨 없이도 RBM-EVAL-OOD 벤치마크에서 Kendall’s τa 0.675를 기록하여, 기존의 완전한 Preference 기반 모델(0.655)보다 우수한 성능을 입증하였습니다. 또한, 잠재적 기반의 보상 형성(potential-based shaping)을 통해 실제 로봇의 정책 학습(Policy Learning)에서 성공률을 Online 시 52.5%에서 72.5%로, Offline 시 63.8%에서 82.5%로 크게 향상시켰습니다.

Figure 2 — 학습 파이프라인 및 주의 기법
4. Conclusion & Impact (결론 및 시사점)
본 연구는 Temporal Distance가 로봇 학습의 보상 및 가치 평가를 위한 확장 가능하고 범용적인 감독 신호(supervision target)임을 입증하였습니다. RynnValue는 라벨링 비용이 많이 드는 preference 데이터 없이도 대규모 이질적 데이터에서 뛰어난 성능을 보이며, 다양한 임베디드 환경과 태스크로의 제로샷(zero-shot) 일반화 가능성을 확인했습니다. 이 연구는 앞으로 로봇 학습 분야에서 보상 모델링의 패러다임을 '사전 정의된 휴리스틱'에서 '데이터 기반의 가치 Foundation Model'로 전환하는 데 중요한 이정표가 될 것입니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Stitched Value Model for Diffusion Alignment
- [논문리뷰] ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
- [논문리뷰] PhyCritic: Multimodal Critic Models for Physical AI
- [논문리뷰] SIMA 2: A Generalist Embodied Agent for Virtual Worlds
- [논문리뷰] SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
Review 의 다른글
- 이전글 [논문리뷰] RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
- 현재글 : [논문리뷰] RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
- 다음글 [논문리뷰] SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
댓글