본문으로 건너뛰기

[논문리뷰] YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

링크: 논문 PDF로 바로 열기

저자: Ruibin Yuan, Jiahao Pan, Junyan Jiang, et al.

1. Key Terms & Definitions

  • YuE2: Symbolic composition과 audio generation을 frontier quality로 통합하는 새로운 모델로, symbolic planning을 핵심 전략으로 사용한다.
  • Symbolic Planning: 완성된 오디오를 생성하기 전에 모델이 멜로디, 하모니, 리듬, 형식 등을 명시하는 가독성 있는 악보(score)를 먼저 작성하는 과정이다.
  • AR–NAR Mixture-of-Transformers (MoT): YuE2의 핵심 아키텍처로, symbolic/semantic token 예측을 위한 Autoregressive (AR) 스트림과 acoustic latent 예측을 위한 Non-Autoregressive (NAR) 스트림을 단일 백본에서 통합한다.
  • MERT2: Recording으로부터 semantic music token sequence를 생성하여 YuE2에 semantic supervision을 제공하는 음악 표현 학습 모델이다.
  • SheetSage2: Recording으로부터 melody, harmony, rhythm, form을 포함하는 editable lead sheet를 복구하여 YuE2에 symbolic supervision을 제공하는 full-song transcription 모델이다.
  • WildSongBench (WSB): 192개의 prompt로 구성된 평가 벤치마크로, in-the-wild 사용자 요청에 기반하여 full-song music generation 시스템의 품질을 평가한다.

2. Motivation & Problem Statement

본 논문은 기존 음악 생성 모델들이 symbolic composition의 가독성과 편집 가능성을 제공하면서도 완성된 오디오를 생성하지 못하거나, 혹은 complete song을 생성하지만 composition을 implicit하게 처리하여 사용자의 명시적인 제어를 어렵게 하는 문제를 해결하고자 한다. 이러한 한계점들은 음악 창작 과정에서 작곡가가 의도하는 바를 명확하게 계획하고 수정하는 것을 방해하며, 최종 오디오 결과물의 품질과 제어 가능성 사이의 trade-off를 야기한다. 특히, 일반적인 오디오 코퍼스(audio corpora)는 이러한 계층적(hierarchical) 생성을 학습하는 데 필요한 악보(notes), 코드(chords), 비트(beats), 섹션(sections)과 같은 aligned symbolic annotation이 부족하다는 한계가 존재한다. 따라서 저자들은 명시적인 작곡 제어와 높은 품질의 오디오 생성이라는 두 가지 목표를 동시에 달성할 수 있는 새로운 통합 모델의 필요성을 강조한다.

3. Method & Key Results

YuE2는 symbolic planning을 통해 symbolic composition과 audio generation을 통합하는 AR–NAR Mixture-of-Transformers (MoT) 기반의 단일 모델을 제안한다 [cite: 1, Figure 3]. 이 방법론은 먼저 텍스트 입력으로부터 melody, chords, key, meter, tempo, form을 포함하는 editable ABC score를 생성하며, 이후 25-Hz MERT2 semantic tokens와 25-Hz continuous acoustic latents로 확장하여 48-kHz stereo VAE decoder를 통해 최종 오디오를 실현한다. 이러한 계층적 생성을 위해 MERT2와 SheetSage2가 도입되어 일반적인 오디오 recording으로부터 aligned symbolic 및 semantic supervision을 구축한다. MERT2는 MuQ 및 Qwen2-Audio-Instruct 인코더를 활용한 Multi-View Target Synthesis를 통해 25-Hz 코드 스트림을 생성하고, Foundation Pretraining 및 Causal Adaptation을 포함하는 4단계 커리큘럼을 거쳐 375 bits/s semantic tokenizer를 학습한다 [cite: 1, Figure 4]. SheetSage2-AR은 full-context MERT2-FS 인코더와 6계층 RoFormer 디코더를 사용하여 recording으로부터 editable lead sheet를 복구한다.

핵심 결과로, symbolic planning은 perceived song quality를 크게 향상시키는 것으로 나타났다. 전문가 평가 결과, symbolic planning을 사용한 생성이 전체 품질(overall quality)에서 49.3%의 선호도를 얻어 planning이 없는 경우의 34.6%보다 우수했으며, musicality에서도 45.0% 대 29.4%로 선호되었다. 또한, YuE2의 unified MoT 아키텍처는 동일한 melody-and-chord planning 조건 하에서 분리된 LM+DiT 모델보다 전체 품질에서 53.4% 대 35.6%로, 오디오 품질(audio quality)에서 48.5% 대 29.6%로 선호되었다. WildSongBench (WSB) 자동 평가에서 YuE2는 SongBench Global Avg 6.73을 기록하며 모든 공개된 baseline 모델들을 능가했다 [cite: 1, Figure 1]. 특히 best-of-8 선택 시에는 6.96으로 모든 시스템 중 가장 높은 평균 점수를 달성했다. MERT2는 MARBLE 벤치마크에서 15개 지표 중 14개에서 SOTA를 달성했으며, SheetSage2-AR은 full-song transcription에서 15개 벤치마크–지표 쌍 중 12개에서 최고 성능을 보였다. score와 audio 간의 높은 일치도(agreement)도 확인되었는데, 생성된 악보와 대응하는 오디오 간의 melody similarity는 0.9464, chord similarity는 0.9246에 달했다.

4. Conclusion & Impact

YuE2는 명시적인 symbolic composition과 high-quality full-song audio generation을 성공적으로 통합하며, 음악 생성 분야의 frontier quality를 제시한다. 본 연구의 가장 중요한 발견은 symbolic planning이 전체 곡 품질(overall quality) 및 musicality에 대한 인식적 선호도를 향상시키고, unified Mixture-of-Transformers (MoT) 아키텍처가 분리된 Language Model (LM) + Diffusion Transformer (DiT) 접근 방식보다 우수하다는 점이다. 이러한 결과는 음악 생성에서 인간이 이해하고 편집할 수 있는 작곡 계획의 중요성을 강력하게 시사한다.

YuE2는 WildSongBench에서 기존 공개 모델들을 뛰어넘는 성능을 보였을 뿐만 아니라, MERT2와 SheetSage2를 통해 music understanding 및 full-song transcription 분야에서 새로운 state-of-the-art를 확립했다. 이는 대규모 unaligned recording으로부터 복잡한 음악적 계층 구조를 학습할 수 있는 기반을 마련했다는 점에서 학계 및 산업계에 큰 시사점을 제공한다. 또한, score를 통한 controlled editing, zero-shot cover generation, 그리고 agentic music editing 기능은 사용자와 AI 에이전트가 작곡 과정을 더욱 직관적이고 반복적으로 제어할 수 있는 새로운 인터페이스를 제공하며, 미래의 human-AI 음악 공동 창작 환경을 위한 강력한 foundational model로서의 잠재력을 보여준다.

Figure 3: YuE2의 생성 개요

Figure 3 — YuE2의 생성 개요

Figure 4: MERT2 다중 뷰 학습

Figure 4 — MERT2 다중 뷰 학습

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글