본문으로 건너뛰기

[논문리뷰] MOSS-VL Technical Report

링크: 논문 PDF로 바로 열기

메타데이터

저자: Pengyu Wang, Chenkun Tan, Shaojun Zhou, et al.


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Gated Cross-Attention: 언어 디코더가 시각적 토큰을 decoded sequence에 직접 주입하지 않고, 별도의 제어 가능한 게이트를 통해 시각 정보에 접근하게 하는 아키텍처 기법입니다.
  • XRoPE (Cross-attention Rotary Position Embedding): 시각적 패치와 텍스트 토큰을 (t, h, w)라는 3축 공유 좌표 공간으로 정렬하여, 시간적 흐름에 따른 위치 정보를 명시적으로 처리하는 포지셔닝 인코딩 방식입니다.
  • Realtime-SFT: 실시간 상호작용 능력을 학습시키기 위한 최종 파인튜닝 단계로, 모델이 언제 발화하고 언제 침묵해야 할지 결정하도록 유도하는 전용 학습 프레임워크입니다.
  • L5 Real-time Regime: 생성 중에도 끊임없이 환경을 지각(Perceive while generating)하여, 새로운 정보가 유입될 때 실시간으로 답변을 수정하거나 중단할 수 있는 모델의 최상위 능력을 지칭합니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 비전-언어 모델(VLM)이 가진 Offline 중심의 비디오 이해 방식의 한계를 극복하기 위해 제안되었습니다. 기존 연구들은 비디오 전체를 먼저 시청한 후 답변하는 L1 수준에 머물러 있거나, 스트리밍 입력을 받더라도 생성 중에는 시각 정보 처리가 불가능하여 blind 상태가 되는 문제를 안고 있었습니다 [Table 1]. 이러한 구조적 한계는 실시간 인터랙션이 중요한 상황에서 즉각적인 반응성이나 능동적인 오류 수정 능력을 저해합니다. 따라서 저자들은 생성 과정과 인식 과정을 분리하지 않고, 실시간으로 시각적 정보를 갱신하며 상호작용할 수 있는 아키텍처를 co-design하는 것이 핵심 과제라고 정의합니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 Gated Cross-Attention을 통해 시각 토큰이 디코더의 시퀀스에 직접 들어가지 않도록 설계함으로써, 모델이 답변을 생성하는 도중에도 지속적으로 최신 프레임을 캐시에 추가하여 실시간 지각이 가능하게 했습니다 [Figure 2]. 또한 XRoPE를 도입하여 시각적 패치와 텍스트 토큰 간의 3차원 위치 관계를 명확히 하고, Absolute Timestamps를 활용해 가변적인 프레임 레이트 환경에서도 정확한 시간 인식을 가능케 했습니다. 학습 전략은 4단계의 커리큘럼 프리트레이닝을 통해 견고한 오프라인 기초를 다진 후, 전체의 3% 미만 토큰을 사용하는 Realtime-SFT 단계에서 실시간 결정 능력을 주입하는 방식을 취합니다.

실험 결과, MOSS-VL-Realtime은 4개의 스트리밍 벤치마크 중 3개에서 최고의 평균 점수를 기록하며 우수성을 증명했습니다. 특히 능동적 반응성을 테스트하는 OmniMMI Proactive Alerting 서브셋에서 66.0점을 기록하여 베이스라인의 37.5점을 크게 상회하는 성능을 보였습니다 [Figure 1]. 또한 시각적 컨텍스트가 증가함에 따라 Time-to-first-token(TTFT) 지연 시간 격차가 기존 모델 대비 최대 5.1x까지 벌어지는 효율성을 입증하여, 실시간 추론의 확장성을 확인했습니다 [Figure 4].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 실시간 인터랙션을 제1원칙으로 삼는 MOSS-VL 아키텍처를 통해 비디오 이해 모델이 L5 실시간 수준으로 도약할 수 있음을 입증했습니다. 특히 모델의 구조, 학습 데이터의 구성, 추론 인프라를 통합적으로 설계한 결과, 기존 스트리밍 모델들이 겪던 답변 생성 중 시각적 정보 상실 문제를 해결했습니다. 이러한 성과는 향후 실시간 보조 AI 시스템이 사용자 환경 변화에 즉각적이고 유연하게 대처할 수 있는 기반 기술로서 학계와 산업계에 중대한 이정표를 제시합니다.


Part 2: 중요 Figure 정보

Figure 1: 스트리밍 벤치마크 결과

Figure 1 — 스트리밍 벤치마크 결과

Figure 2: MOSS-VL 아키텍처

Figure 2 — MOSS-VL 아키텍처

Figure 4: 실시간 추론 효율 비교

Figure 4 — 실시간 추론 효율 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글