본문으로 건너뛰기

[논문리뷰] WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation

링크: 논문 PDF로 바로 열기

저자: Yubo Zhu, Yawen Shao, et al.

1. Key Terms & Definitions

  • WanPE: 397B-parameter 규모의 프롬프트 인핸스먼트(Prompt Enhancement) 모델로, Text-to-Video (T2V) 생성 과정에서 감독 수준의 시네마틱 플래닝(Cinematic Planning) 능력을 목표로 합니다.
  • Text-to-Video (T2V) Generation: 텍스트 입력을 바탕으로 비디오를 생성하는 기술입니다. 최신 T2V 시스템은 프롬프트 인핸서(Prompt Enhancer)와 비디오 제너레이터(Video Generator)로 구성됩니다.
  • Cinematic Planning: 멀티샷(Multi-shot) 시퀀스에 걸쳐 액션, 카메라 궤적, 조명, 사운드 등 전체 비디오 프로덕션을 텍스트 프롬프트를 통해 지시하는 과정입니다.
  • Video-Grounded Reverse Construction: 훈련 데이터 생성을 위한 프롬프트-캡션(Prompt-Caption) 페어 구성 방식입니다. 실제 비디오에서 계층적 시네마틱 조건(캡션)을 도출한 다음, 해당 캡션에서 호환되는 사용자 요청(User Request)을 재구성하여 인핸서의 출력을 실제 비디오 기반 캡션 분포에 맞춥니다.
  • Semantic-Consistency GRPO (SC-GRPO): Group Relative Policy Optimization (GRPO)에 시맨틱 일관성(Semantic Consistency) 리워드(Reward)를 적용한 방법론입니다. 이는 생성된 시네마틱 플랜에서 사용자 요구사항의 누락, 변경, 불일치 및 시간적 불일치를 페널티(Penalty)로 처리하여 시맨틱 충실도를 강화합니다.
  • WanPEval: 다양한 생성 길이(5-30초)와 요청 복잡도(고수준 의도부터 상세 샷 레벨 지시까지)를 포괄하는, 인간이 주석을 달아 구성한 T2V 프롬프트 인핸서 평가용 테스트베드(Testbed)입니다.

2. Motivation & Problem Statement

본 연구는 최신 Text-to-Video (T2V) 제너레이터가 장시간의 시네마틱 품질 비디오를 생성할 수 있게 되면서, 텍스트 프롬프트의 역할이 더욱 중요해진 상황에 주목합니다. 기존 프롬프트 인핸스먼트(Prompt Enhancement) 방식은 주로 사용자 요청을 풍부한 설명으로 "Forward Expansion"하는 데 집중했으나, 이는 비디오 제너레이터가 실제 "Video-Grounded Captions"로 훈련되기 때문에 "Training–Inference Mismatch"를 야기합니다 [cite: 1, Figure 1]. 이러한 불일치는 인핸서의 출력이 실제 비디오 기반 분포가 아닌 합성된 재작성(Rewriting) 분포를 따르게 만듭니다. 두 번째 핵심 문제는 복잡한 시네마틱 플랜 전반에 걸쳐 "Long-Range Semantic Fidelity"를 유지하는 것입니다. 즉, 사용자가 지정한 주체, 액션, 대화 및 시간적 관계가 여러 샷(Shot)에 걸쳐 일관되게 보존되어야 합니다.

3. Method & Key Results

저자들은 이러한 문제를 해결하기 위해 프롬프트 인핸스먼트 프레임워크를 "Cinematic Planning" 아키텍처로 재설계한 WanPE를 제안합니다. WanPE는 두 가지 핵심 방법론을 통해 구현됩니다:

  1. Video-Grounded Supervised Fine-Tuning (SFT): 기존 "Forward Expansion" 대신 "Video-Grounded Reverse Construction" 방식을 사용합니다. 1.05M개의 실제 비디오 클립을 수집하고, 멀티모달 비디오 캡셔너(Multimodal Video Captioner)를 통해 비디오 기반의 계층적 "Cinematic Captions" (y)를 생성합니다. 이후 LLM(gpt-5.4)을 Few-shot Prompting과 함께 사용하여 이 캡션에서 호환 가능한 사용자 요청(x)을 재구성하여 훈련 데이터셋을 구축합니다. [Figure 2] 이 방식은 인핸서가 실제 시네마틱 구조를 학습하고, 실제 비디오 기반 캡션 분포와 일치하는 출력을 생성하도록 돕습니다.
  2. Semantic-Consistency GRPO (SC-GRPO): 시네마틱 플랜 전반에 걸쳐 사용자 요구사항의 "Semantic Fidelity"를 유지하기 위해 SC-GRPO를 도입합니다. 이는 "Nine-Dimensional Reward" (스타일, 주체, 액션, 카메라 등 9가지 측면)를 사용하여 생성된 시네마틱 플랜에서 요구사항의 누락, 변경, 잘못된 바인딩(Binding), 시간적 불일치에 대해 페널티를 부과하며, Qwen3.7-Max로 평가됩니다.

Figure 2: WanPE 학습 파이프라인

Figure 2 — WanPE 학습 파이프라인

핵심 결과로, WanPE-397B 모델은 Wan3.0 비디오 제너레이터와 결합했을 때, 원본 사용자 프롬프트(Raw User Prompts) 대비 인간 선호도(Human Preference)를 크게 향상시켰습니다. 특히 5-15초 길이 비디오에서는 10.66-18.84 포인트, 30초 길이 비디오에서는 무려 50.86 포인트의 향상을 보였습니다. WanPEval 벤치마크의 5-15초 서브셋에서, WanPE-397B는 LTX-2.5, Kling 3.0, HappyHorse 1.1, MiniMax-H3, Seedance 2.0 등 다른 상업용 시스템들을 모두 능가하며, 50.61 (SS) 및 61.85 (BT)의 종합 선호도 점수로 1위를 차지했습니다. [Table 1] 30초 길이 비디오에서는 Seedance 2.5에 필적하는 60.24 (SS)를 달성하며, 원본 요청 대비 9.38 (SS)에서 크게 개선된 성능을 보였습니다. [Table 2] 어블레이션 스터디(Ablation Study) 결과, "Video-Grounded Reverse Construction"이 "Forward Rewriting" 방식보다 우수함을 입증했으며, WanPE-397B-SFT가 49.86 (SS)으로 "Forward Rewriting"의 39.49 (SS)보다 높은 성능을 기록했습니다. [Table 2] 또한, SC-GRPO는 "Semantic Consistency" 점수를 18.6-23.3 포인트 향상시켰고, 이는 완벽한 출력 비율 증가 및 실패 감소로 이어졌습니다. [Table 3] 이러한 "Semantic Consistency" 향상은 다운스트림 비디오 품질 개선에도 기여하여, WanPE-397B의 종합 선호도 점수를 42.70에서 49.69로 상승시켰습니다.

4. Conclusion & Impact

본 연구는 최신 비디오 제너레이터 환경에서 프롬프트 인핸스먼트의 역할을 재정의하며, 프롬프트를 단순한 설명 캡션이 아닌 액션, 카메라 안무, 오디오, 내러티브를 시퀀스에 걸쳐 조율하는 "Cinematic Blueprint"로 개념화했습니다. 제안된 WanPE는 "Video-Grounded Reverse SFT"를 통해 실제 시네마틱 구조를 학습하고, "SC-GRPO"를 통해 사용자 요구사항의 "Semantic Fidelity"를 충실히 보존함으로써 이 시네마틱 플래닝 아키텍처를 효과적으로 구현했습니다. WanPE 모델을 4B에서 397B까지 스케일링(Scaling)한 결과, "Semantic Fidelity"와 "Downstream Video Quality"가 일관되게 향상됨을 입증했으며, "Reverse Construction"이 "Forward Rewriting"보다 우수하고 SC-GRPO가 모델 규모 전반에 걸쳐 "Semantic Fidelity"를 개선함을 확인했습니다. 이러한 발견은 Text-to-Video 생성 분야의 프롬프트 인핸스먼트 발전을 위한 신뢰할 수 있는 토대를 마련하고, 텍스트 입력으로부터 더욱 정교하고 일관성 있는 비디오 합성을 가능하게 할 것입니다.

Figure 1: 초기 모델과 WanPE 출력 비교

Figure 1 — 초기 모델과 WanPE 출력 비교

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글