본문으로 건너뛰기

[논문리뷰] FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

링크: 논문 PDF로 바로 열기

저자: Dingyun Zhang, Lixue Gong, Wei Liu

## 1. Key Terms & Definitions (핵심 용어 및 정의)

  • Pixel-pair Temporal Warped Flow Field: 이미지 편집 쌍을 비디오 시퀀스로 변환하기 위해 동일한 공간적 변형을 소스와 타겟 이미지에 적용하는 기술적 프레임워크입니다.
  • Modality Mimic Generation/Editing Loss: T2I(Text-to-Image)와 T2V(Text-to-Video) 또는 I2I와 V2V 간의 출력 분포를 정렬하여 상호 모달리티 학습을 촉진하는 손실 함수입니다.
  • Sense-related Tasks: Referring Expression Segmentation과 같은 태스크를 통해 모델이 텍스트 지시와 비디오 내 특정 영역 간의 관계를 내부적으로 이해하도록 돕는 학습 방식입니다.
  • Wan2.1-T2V-1.3B: 본 연구의 기반 모델로 사용된 Pretrained T2IV model로, 효율적인 비디오 생성 및 편집 기능을 제공합니다.

## 2. Motivation & Problem Statement (연구 배경 및 문제 정의) 본 연구는 고비용의 수작업 데이터셋 의존도를 낮추고 범용적인 비디오 편집 능력을 확보하기 위해, 이미지 편집 데이터로부터 실시간으로 비디오 편집 샘플을 생성하는 새로운 데이터 패러다임을 제안합니다. 기존 비디오 편집 연구들은 MLLMs를 활용한 마스크 주석, 대규모 데이터셋 큐레이션, 복잡한 필터링 공정 등 확장성(scalability)이 낮은 파이프라인에 크게 의존해 왔습니다. 또한, 단일 프레임 편집과 비디오 편집 간의 모달리티 간 분포 불일치 문제로 인해 모델이 자연스러운 비디오 편집을 수행하는 데 한계를 보였습니다. 이러한 문제들을 해결하기 위해 제안된 기법은 [Figure 1]에 나타난 바와 같이 시간적 일관성을 갖춘 픽셀 대응 관계를 활용합니다.

Figure 1: 전체 데이터 생성 패러다임의 핵심 다이어그램

Figure 1 — 전체 데이터 생성 패러다임의 핵심 다이어그램

## 3. Method & Key Results (제안 방법론 및 핵심 결과) 본 연구는 pixel-pair temporal warped flow field를 도입하여 이미지 편집 샘플을 실시간으로 고품질의 비디오 편집 데이터로 변환하며, 이를 통해 추가적인 비디오 편집 데이터 없이도 모델이 편집 능력을 학습하도록 구성합니다. 특히, [Figure 2][Figure 4]에서 볼 수 있듯이, 모델이 생성 및 편집 단계에서 두 모달리티 간의 출력 분포를 정렬하도록 하는 modality mimic loss를 설계하였습니다. 또한, 특정 영역을 수정하는 sense-related tasks를 통해 별도의 마스크 입력 없이도 텍스트 기반의 정밀한 지역적 편집이 가능하게 하였습니다. 실험 결과, 학습률을 5×10⁻⁶에서 1×10⁻⁵로 점진적으로 높이는 전략을 통해 수천 번의 학습 단계만으로도 비디오 편집 태스크에 빠르게 반응하는 성능을 달성하였습니다. 다양한 편집 유형(stylization, object removal, object addition 등)에서 본 모델은 기존 pretrained T2IV model 대비 더 정교한 지역적 제어와 일관된 결과물을 보여주었습니다.

Figure 2: 모델의 학습 과정 및 모달리티 mimic 손실 구조를 설명하는 핵심 다이어그램

Figure 2 — 모델의 학습 과정 및 모달리티 mimic 손실 구조를 설명하는 핵심 다이어그램

Figure 4: 편집 학습을 위한 아키텍처 적응 및 모달리티 mimic 편집 손실 구조도

Figure 4 — 편집 학습을 위한 아키텍처 적응 및 모달리티 mimic 편집 손실 구조도

## 4. Conclusion & Impact (결론 및 시사점) 본 논문은 이미지 편집 데이터로부터 비디오 편집을 가능하게 하는 확장 가능한 데이터 생성 패러다임과 이를 최적화하기 위한 모달리티 정렬 기법을 제안합니다. 이 연구를 통해 모델이 별도의 외부 툴이나 명시적인 마스크 입력 없이도 텍스트 지시를 이해하고 시간적 일관성을 유지하며 편집하는 내부적 역량을 확보할 수 있음을 입증하였습니다. 제안된 방법론은 비디오 편집 분야에서 데이터 수집 효율성을 획기적으로 개선하며, 다양한 비디오 생성 및 편집 태스크에 범용적으로 적용 가능한 토대를 마련하였습니다. 향후 연구는 더욱 다양한 도메인의 데이터와 결합하여 고품질의 공간-시간적 일관성을 극대화하는 방향으로 발전할 것으로 기대됩니다.


⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글