본문으로 건너뛰기

[논문리뷰] ReferTrack: Referring Then Tracking for Embodied Visual Tracking

링크: 논문 PDF로 바로 열기

메타데이터

저자: Hanjing Ye, Tianle Zeng, Jiazhao Zhang, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Refer-CoT (Referring Chain-of-Thought): 에이전트가 언어 지시에 따라 현재 시점의 객체들 중 목표 대상을 인덱스 기반으로 선택하는 추론 메커니즘입니다.
  • TVBI (Temporal-Viewpoint-Bbox Indicator): 과거에 선택된 목표 대상의 Bounding Box 좌표 정보를 시공간적 히스토리에 주입하여, 추후 경로 계획 시 목표 지향적 정보를 제공하는 토큰 기법입니다.
  • Refer-QA: 대규모 데이터셋을 기반으로 이미지 내의 목표 대상을 정확히 지칭하고 추론하도록 학습시키는 지표 기반의 질의응답 보조 학습 과정입니다.
  • EVT-Bench: 모바일 에이전트의 시각적 추적 성능을 평가하기 위한 표준 벤치마크로, 단일 대상, 주의 분산, 모호성 환경을 포함합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Embodied Visual Tracking (EVT) 분야에서 추상적인 공간 Latent를 통한 추론이 실제 이미지 기반 탐지와 불일치하는 문제를 해결하고자 합니다. 기존의 VLA (Vision-Language-Action) 모델들은 target identification과 trajectory planning을 통합하지만, CoT 추론 과정이 시각적 데이터와 명확히 정렬되지 않아 복잡하고 혼잡한 환경에서 성능이 저하되는 한계가 있습니다 [Figure 1]. 이러한 문제점을 극복하기 위해, 본 연구는 'Referring Then Tracking'이라는 새로운 패러다임을 제안하여 추론 과정을 시각적으로 명확한 Bounding Box 기반으로 설계하고자 합니다.

Figure 1: ReferTrack의 Referring-then-Tracking 개요

Figure 1 — ReferTrack의 Referring-then-Tracking 개요

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 ReferTrack을 제안하며, 이는 현재 관측된 Bounding Box 후보군에서 Refer-CoT 토큰을 통해 목표를 우선 선택한 뒤, 해당 정보를 TVBI를 통해 히스토리에 통합하여 경로를 생성하는 end-to-end 프레임워크입니다 [Figure 2]. 본 모델은 Qwen3-4B를 백본으로 사용하며, Refer-QA 데이터셋을 활용한 co-training을 통해 시각적 정렬 성능을 극대화하였습니다. 실험 결과, EVT-Bench에서 단일 카메라 설정만으로도 이전 모델들을 압도하는 성능을 기록하였습니다. 특히, Distracted Tracking (DT) split에서 73.3%의 Success Rate(SR)를 달성하여 기존 SOTA 모델 대비 비약적인 향상을 보였으며, 복잡한 환경에서의 Ambiguity Tracking (AT) 성능 역시 74.1%로 대폭 향상되었습니다 [Table 1]. 이러한 결과는 별도의 강화학습(RL) 없이도 명시적인 Refer-CoT 설계가 목표 추적의 핵심 동인이 됨을 시사합니다.

Figure 2: ReferTrack 전체 모델 아키텍처

Figure 2 — ReferTrack 전체 모델 아키텍처

4. Conclusion & Impact (결론 및 시사점)

본 논문은 ReferTrack을 통해 복잡한 시각적 환경에서 목표 지향적인 추적을 수행하는 효과적인 경로를 제시했습니다. 본 연구는 명시적인 이미지-공간 기반의 Referring 기법과 Temporal Memory 활용이 모델 스케일업이나 고비용 RL 학습의 의존도를 낮출 수 있음을 증명했습니다. 향후 실제 로봇 플랫폼(Unitree Go2, G1)에서의 검증은 본 모델의 견고한 sim-to-real 전이 능력과 실시간 성능을 확립하며, 향후 embodied AI 연구에 중요한 기술적 이정표를 제시합니다 [Figure 3].

Figure 3: 실제 로봇 플랫폼 배포 결과

Figure 3 — 실제 로봇 플랫폼 배포 결과

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글