본문으로 건너뛰기

[논문리뷰] MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

링크: 논문 PDF로 바로 열기

메타데이터

저자: Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Any-to-Any Modeling: 텍스트, RGB 이미지, 깊이(Depth), 표면 법선(Surface Normals) 등 다양한 모달리티 간의 임의적인 매핑과 변환을 단일 프레임워크 내에서 수행하는 연구 패러다임입니다.
  • Decoder-Only Architecture: 별도의 인코더나 모달리티별 헤드(Head) 없이, 단일 Transformer 디코더에서 모든 입력과 출력을 처리하는 구조입니다.
  • Flow Matching: 2D 공간 모달리티의 잠재 표현(Latent Representation)을 생성하기 위해 사용되는 기법으로, 노이즈가 섞인 잠재 변수를 깨끗한 타겟 이미지로 변환하는 속도장(Velocity Field)을 학습합니다.
  • Modus-Dataset: 연구진이 제안한 29M 규모의 데이터셋으로, 15개의 다양한 모달리티(기하학적, 구조적, 의미적, 표현적 정보)가 단일 이미지 베이스에 정렬되어 있습니다.
  • Chained Generation: 이전 단계에서 생성된 모달리티를 다음 단계의 조건(Conditioning)으로 재사용하여, 단계별로 모달리티를 변환하는 추론 방식입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 Any-to-Any 모델들이 Encoder-Decoder나 Diffusion 아키텍처에 의존하여 대규모 사전 학습된 Decoder-only 모델의 강력한 성능을 활용하지 못하는 한계를 해결하고자 합니다. 기존 연구들은 종종 모달리티별로 특화된 헤드나 손실 함수를 사용해야 하므로 프레임워크의 확장성과 유연성이 떨어지는 문제가 있었습니다 [Figure 1]. 이러한 문제로 인해 다양한 모달리티를 대칭적으로 다루면서도 사전 학습된 모델의 priors를 계승할 수 있는 통합된 Decoder-only 모델에 대한 필요성이 대두되었습니다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 1D Expert(언어, 피처 등)와 2D Expert(이미지, Depth 등)를 단일 디코더 내에서 통합한 Modus를 제안합니다 [Figure 3]. 제안 방법론은 1D 모달리티에는 Next-Token Prediction(NTP)을, 2D 모달리티에는 Flow Matching을 적용하여 모달리티를 대칭적으로 처리하며, 학습 과정에서는 Uniform Timestep Sampling을 도입해 모달리티 혼동(Modality Confusion) 문제를 효과적으로 완화했습니다 [Figure 4].

주요 실험 결과로서, Modus는 다양한 벤치마크에서 기존 specialist 모델 및 multitask 베이스라인과 대등하거나 우수한 성능을 입증했습니다 [Table 1]. 특히, NYUv2 데이터셋에서 표면 법선 예측 지표인 19.92를 기록하였으며, RefCOCO_val_ 벤치마크에서 54.5라는 경쟁력 있는 grounding 성능을 달성하였습니다. 또한, 체인형 생성(Chained Generation)을 통해 RGB → Canny Edge → Surface Normal과 같이 단계별로 정보가 정렬된 더 높은 품질의 출력을 생성할 수 있음을 입증했습니다 [Figure 7].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 Decoder-only 모델이 특수화된 헤드 없이도 다수의 모달리티를 성공적으로 통합할 수 있음을 증명했습니다. Modus는 Any-to-Any 생성, chained generation, cross-modal self-verification과 같은 새로운 기능들을 단일 프레임워크 내에서 구현함으로써 멀티모달 학습의 새로운 지평을 열었습니다. 이러한 범용적이고 확장 가능한 모델링 방식은 향후 과학적 도메인을 포함한 다양한 분야에서 파운데이션 모델의 활용도를 대폭 높일 것으로 기대됩니다.


Part 2: 중요 Figure 정보

Figure 1: Modus 아키텍처 및 기능 요약

Figure 1 — Modus 아키텍처 및 기능 요약

Figure 3: Modus 프레임워크 개요

Figure 3 — Modus 프레임워크 개요

Figure 7: Any-to-Any 체인형 생성

Figure 7 — Any-to-Any 체인형 생성

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글