본문으로 건너뛰기

[논문리뷰] Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

링크: 논문 PDF로 바로 열기

메타데이터

저자: Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Spoken Motion Model: 발화 응답(Speech response)과 이에 수반되는 전신 움직임(Full-body motion)을 동일한 대화 문맥에서 동시에 생성하는 모델을 의미합니다.
  • TQGF (Token-as-Query Gated Fusion): Speech Generator의 토큰 임베딩이 LLM의 contextualized hidden states를 쿼리하여 모션 생성 시 필요한 시각적/맥락적 정보를 추출하는 게이트 메커니즘입니다.
  • LOM (Language of Motion): 네 가지 신체 부위(얼굴, 손, 상체, 하체)별 VQ-VAE 코드북을 활용하는 모션 생성 프레임워크로, 본 논문에서는 motion teacher이자 디코더로 사용됩니다.
  • FGD (Fréchet Gesture Distance): 생성된 모션 특징의 분포와 참조 모션 분포 사이의 거리를 측정하여 모션 생성의 품질과 일치성을 평가하는 주요 지표입니다.
  • SwDA-500: 오픈 엔디드(Open-ended) 방식의 전신 spoken dialogue를 평가하기 위해 고안된 새로운 벤치마크 데이터셋 및 평가 프로토콜입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 대화형 AI에서 발화와 신체 움직임이 분리되어 생성되는 기존 Cascade 방식의 한계점을 해결하고자 합니다. 기존 방식은 발화 생성 후 별도의 모션 모델을 수행하여 추론 지연(Latency)이 발생하며, 두 모듈 간의 공동 최적화(Joint optimization)가 불가능하다는 구조적 결함이 있습니다. 저자들은 이러한 제약을 극복하고, LLM의 hidden states로부터 발화와 모션을 네이티브(Native)하게 동시 생성하는 프레임워크를 제안합니다. 이를 통해 모션 생성 목표가 발화 생성의 표현력까지 함께 개선하도록 유도하는 것을 핵심 과제로 설정했습니다 [Figure 1].

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Motion-Omni 프레임워크를 제안하며, 이는 Speech Projector, LLM Backbone, Speech Generator, Part-Aware Motion Generator의 4단계 컴포넌트로 구성됩니다. 제안 모델은 Progressive Training Curriculum을 통해 4단계(ASR → TTS → TTSM → Joint Mixture)로 학습되며, 특히 TQGF를 통해 Speech Generator의 hidden states를 조건부 입력으로 활용하여 모션과 발화 간의 시공간적 일치성을 보장합니다.

실험 결과, Motion-Omni-Q7은 모션 품질 측면에서 teacher-cascade 대비 2% 이내의 성능 차이를 유지하면서도, 추론 속도는 5.4배 더 빠른 RTF=0.78을 기록하여 실시간성을 확보했습니다. 또한, omni-modal 시스템 비교에서 가장 우수한 2.62%WER(Word Error Rate)을 달성하여 발화의 정확성 면에서도 탁월함을 증명했습니다 [Table 2]. 특히 joint training을 거치지 않은 frozen speech pathway 모델 대비 모션과 음성의 정렬(Alignment) 품질이 현저히 향상되었음을 확인하였습니다.

4. Conclusion & Impact (결론 및 시사점)

본 연구는 발화와 전신 모션을 하나의 LLM 기반 구조에서 네이티브하게 생성하는 Motion-Omni를 통해 spoken dialogue 시스템의 새로운 패러다임을 제시했습니다. 모델-애그노스틱(Model-agnostic)한 pseudo-labeling 파이프라인을 통해 대규모 데이터를 효과적으로 구축하였으며, 제안된 벤치마크 SwDA-500은 향후 전신 인터랙티브 아바타 연구의 표준이 될 것으로 기대됩니다. 본 연구는 실시간성과 자연스러운 비언어적 소통을 결합한 대화형 에이전트 개발에 있어 중요한 학술적·산업적 기틀을 마련했습니다.


Part 2: 중요 Figure 정보

Figure 1: Motion-Omni 전체 아키텍처

Figure 1 — Motion-Omni 전체 아키텍처

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글