본문으로 건너뛰기

[논문리뷰] InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter

링크: 논문 PDF로 바로 열기

메타데이터

저자: Yunze Tong, Mushui Liu, Canyu Zhao, Shiyi Zhang, Didi Zhu, Peng Zhang, Wanggui He, Jinlong Liu, Ying Chen, Hao Jiang, Pipei Huang, Bo Zheng


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Infinite Video Editing: 이전 프레임 시퀀스를 기반으로 새로운 편집 요청을 수행하며, 편집된 결과가 미래 프레임으로 자연스럽게 이어지는 연속적인 비디오 편집 작업입니다.
  • Edit-Ignition Adapter: Helios와 같은 스트리밍 비디오 생성 모델에 통합되어, 편집 요청이 발생할 때만 활성화되어 편집을 '점화(Ignite)'시키고 이후 생성을 제어하는 경량 어댑터 블록입니다.
  • History Cross-Attention: 입력 프레임과 생성 중인 청크 사이의 정렬을 담당하며, 이전 프레임의 맥락을 현재 생성 과정에 효과적으로 주입하는 메커니즘입니다.
  • Temporal Causal Self-Attention: 생성되는 비디오 청크 내에서 시간적 인과 관계를 유지하며, 이전 프레임에서 이후 프레임으로 시간적 단서가 흐르도록 제한하는 어텐션 모듈입니다.
  • Flow-Matching Objective: 비디오 생성 학습을 위해 사용되는 최적화 기법으로, 잡음이 섞인 잠재 변수로부터 깨끗한 타겟 비디오로의 속도(velocity)를 회귀하는 방식입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 고정된 프레임 범위에서만 작동하는 in-place 편집 방식의 한계를 극복하고, 개방형 스트리밍 환경에서 무제한으로 이어지는 비디오 편집을 수행하는 Infinite Video Editing을 제안합니다. 기존 연구들은 비디오 편집을 정적인 입력 클립에 대한 변환으로 간주하여 실시간 게임 스트림이나 지속적인 카메라 움직임과 같은 상황에 대응하지 못합니다 [Figure 1]. 또한, 무한한 편집 과정에서 편집 내용이 미래 프레임으로 자연스럽게 이어져야 하는 faithful continuation과 편집이 누적될 때 생성 품질이 유지되어야 하는 stability라는 두 가지 핵심 과제를 해결해야 합니다. 단순히 기존 생성 모델의 프롬프트를 교체하는 방식은 이전 생성 내용의 강한 prior로 인해 편집 요청이 무시되는 경향이 있어, 이를 위한 전용 아키텍처 설계가 필요합니다.

Figure 1: 데이터 수집 파이프라인

Figure 1 — 데이터 수집 파이프라인

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Helios 모델을 frozen backbone으로 활용하고, 편집 요청을 주입하는 경량 Edit-Ignition Adapter를 추가한 InfinityEdit 프레임워크를 제안합니다 [Figure 2]. 이 어댑터는 세 가지 어텐션 모듈(History Cross-Attention, Temporal Causal Self-Attention, Edit Cross-Attention)을 통해 편집 요청을 점화하고, 이후 frozen backbone이 안정적으로 생성을 이어가도록 설계되었습니다. 추론 시에는 편집 요청이 들어온 청크에만 어댑터를 활성화하고, 나머지 단계에서는 backbone이 생성하는 'ignite-then-continue' 전략을 사용합니다 [Figure 3]. History CorruptionMixture-Gaussian Sampling을 활용한 2단계 커리큘럼 학습을 통해 편집 성능과 생성 안정성을 극대화하였습니다. 실험 결과, InfinityEdit은 12개의 연속적인 청크에서도 높은 편집 정렬도(edit alignment)와 시간적 일관성을 유지하였으며, 특히 기존 baseline 대비 장기 생성 품질 및 편집 충실도에서 우수한 성능을 입증하였습니다.

Figure 2: 제안 모델의 전체 아키텍처

Figure 2 — 제안 모델의 전체 아키텍처

Figure 3: 추론 파이프라인

Figure 3 — 추론 파이프라인

4. Conclusion & Impact (결론 및 시사점)

본 논문은 반복적인 편집 요청이 발생하는 스트리밍 환경에서 무제한으로 비디오를 편집할 수 있는 Infinite Video Editing이라는 새로운 과제를 정의하고 이를 해결하기 위한 InfinityEdit 아키텍처를 제시합니다. 제안된 방법론은 frozen backbone의 강력한 생성 prior를 보존하면서도 유연한 편집 제어가 가능하게 함으로써, 라이브 스트리밍 콘텐츠의 실시간 편집 및 확장 가능한 생성 AI 생태계에 중요한 기술적 토대를 마련하였습니다. 향후 이 연구는 고품질의 실시간 비디오 편집을 요구하는 다양한 산업 분야, 특히 게임 스트리밍이나 대화형 비디오 시스템 등에 핵심적인 기반 기술로 활용될 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글