[논문리뷰] CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
링크: 논문 PDF로 바로 열기
메타데이터
저자: Fuchen Long, Cong Wang, Zitao Gao, et al.
1. Key Terms & Definitions (핵심 용어 및 정의)
- Compositional Instruction-Guided Video Editing: 단일 영상 내에서 서로 다른 여러 편집 의도를 동시에 이해하고, 공간적·시간적 일관성을 유지하며 복합적으로 적용하는 편집 방식.
- CoinVE-200K: 복합적인 편집 명령(compositional instructions)을 지원하기 위해 구축된 20만 개의 고품질 영상-편집 쌍으로 구성된 대규모 데이터셋.
- CoinVE-Edit: Wan2.1-T2V-14B 및 Qwen3-VL-8B를 백본으로 활용하여 지역 기반 주의 집중(region-aware attention)을 분리함으로써 다중 지역 편집을 수행하는 모델.
- Q-Blending Cross-Attention: 여러 편집 명령의 토큰을 마스크와 게이트 정보를 사용하여 동적으로 결합함으로써 사전 학습된 DiT 가중치를 수정하지 않고 다중 지역 편집을 가능하게 하는 메커니즘.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 영상 편집 데이터셋이 단일 작업 위주로 구성되어, 다중 의도를 동시에 수행해야 하는 실제 영상 편집 시나리오를 제대로 반영하지 못하는 한계를 해결하고자 한다 [Figure 1]. 기존 연구들은 여러 편집 명령이 혼재될 경우 명령 간 간섭(instruction interference), 의도치 않은 지역 변형, 시간적 불일치 등의 문제를 야기한다. 특히 복잡한 상호작용이 요구되는 compositional editing을 수행하기 위한 데이터셋과 모델의 부재는 영상 편집 분야의 발전을 저해하는 핵심 요소이다. 이에 저자들은 대규모 고품질 데이터셋과 이를 체계적으로 평가할 수 있는 벤치마크, 그리고 효율적인 다중 의도 편집 모델을 제안한다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 데이터 구축부터 모델링까지 포괄적인 프레임워크를 제안한다. 먼저, Qwen3.6-27B와 SAM3를 활용하여 영상 내 편집 가능한 영역을 식별하고 구성적 편집 명령을 생성하는 데이터 파이프라인을 구축하였다 [Figure 2]. 제안 모델인 CoinVE-Edit는 MLLM을 통해 영상을 이해하고, Mask Predictor와 GateNet을 사용하여 각 명령의 영향을 받는 지역과 편집 타입을 결정한다 [Figure 4]. 특히 Q-Blending Cross-Attention을 통해 여러 편집 명령이 독립적으로 작용하면서도 영상 전반의 시간적 일관성을 보존하도록 설계하였다. 실험 결과, CoinVE-200K는 평균적으로 영상당 2.55개의 명령을 포함하며 4.85점의 높은 편집 품질 점수를 기록하였다. 또한, CoinVE-Edit는 CoinVE-Bench에서 기존 모델 대비 더 나은 compositional instruction following 능력과 지역적 편집 정밀도, 그리고 비편집 영역 보존 성능을 입증하였다.
4. Conclusion & Impact (결론 및 시사점)
본 논문은 복합적인 영상 편집이라는 새로운 도전 과제에 대응하기 위해 대규모 데이터셋인 CoinVE-200K와 모델 CoinVE-Edit를 제시한다. 본 연구는 단일 작업 위주였던 영상 편집 기술을 다중 의도 해석 및 수행이 가능한 차세대 생성형 AI 수준으로 끌어올리는 데 기여하였다. 제안된 벤치마크와 데이터 구축 파이프라인은 향후 학계와 산업계에서 복잡한 영상 콘텐츠 제작 시스템을 구축하는 데 중요한 초석이 될 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation
- [논문리뷰] SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
- [논문리뷰] ShotPlan: Cinematic Video Generation with Learnable Planning Token
- [논문리뷰] Motion4Motion: Motion Transfer Across Subjects at Inference
- [논문리뷰] LooseControlVideo: Directorial Video Control using Spatial Blocking
Review 의 다른글
- 이전글 [논문리뷰] CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation
- 현재글 : [논문리뷰] CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
- 다음글 [논문리뷰] Cross-Model Memory Transfer via Target-Side Reader Adaptation
댓글