본문으로 건너뛰기

[논문리뷰] AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

링크: 논문 PDF로 바로 열기

저자: Yuqing Wen, Yukai Huang, et al.

1. Key Terms & Definitions

  • AVE-Compass: 자유형(free-form) 오디오-비디오 편집을 위한 포괄적인 벤치마크로, 145개의 큐레이션된 원본 비디오, 196개의 오디오-비디오 결합 편집 지시, 그리고 2,688개의 세분화된 체크리스트 항목으로 구성된다.
  • Instruction Following (IF): 요청된 수정(modification)이 의도된 대상에 올바르게 적용되고 지정된 의미(semantics)와 일치하는지 평가하는 지표이다.
  • Fidelity Preserving (FP): 비편집(non-edited) 콘텐츠가 원본과 일관성을 유지하고 의도치 않은 콘텐츠가 도입되지 않았는지 평가하는 지표이다.
  • Realism (REAL): 편집된 클립의 전반적인 자연스러움과 일관성(coherence)을 평가하며, 시각적 타당성, 물리적 일관성, 그리고 시각적 콘텐츠와의 음향적 일관성에 중점을 둔다.
  • Editing Intent (EI): IFFP를 결합한 복합 지표(IF × FP)로, 편집이 수행되고 비대상 콘텐츠가 보존될 때만 점수를 부여하여 완전한 편집 실행(complete edit execution)을 나타낸다.
  • AVE-Agent: 복잡한 지시를 종속적인 하위 작업으로 분해하고, 자체 반성(self-reflection) 및 평가자 피드백을 통해 편집 결과를 반복적으로 개선하는 모듈형 에이전트 프레임워크이다.

2. Motivation & Problem Statement

본 논문은 지시 기반(instruction-based) 비디오 편집 모델의 평가에 있어 중요한 격차를 해결하고자 한다. 특히, 오디오와 시각 신호가 밀접하게 결합된 실제 비디오를 다루는 모델의 능력 평가에 초점을 맞춘다. 기존 벤치마크들은 주로 무음 클립(silent clips)에 대한 시각적 변환이나 고립된 오디오 편집만을 평가하여, 복잡한 오디오-비디오 편집 및 교차 모달(cross-modal) 일관성 문제를 충분히 탐구하지 못했다. 현재의 평가 지표들은 오디오-비디오 편집에서 발생할 수 있는 잘못된 배경음 제거 또는 편집된 시각 이벤트와 오디오 이벤트 간의 시간적 불일치와 같은 중요한 실패를 진단하기에는 너무 조악하다(coarse-grained). 이러한 한계점은 모델이 암묵적인 교차 모달 요구사항을 이해하고, 오디오-비디오 동기화를 유지하며, 비대상 콘텐츠를 보존하는 능력을 전체적으로 평가하는 데 방해가 된다 [cite: 1, Figure 1].

3. Method & Key Results

저자들은 자유형 오디오-비디오 편집을 평가하기 위한 포괄적인 벤치마크인 AVE-Compass를 도입한다. 이 벤치마크는 145개의 큐레이션된 원본 비디오, 196개의 오디오-비디오 결합 편집 지시, 그리고 2,688개의 세분화된 체크리스트 항목으로 구성된다. AVE-Compass는 모델 성능을 Instruction Following (IF), Fidelity Preserving (FP), Realism (REAL), 그리고 Editing Intent (EI)로 분리하여 진단적 평가를 가능하게 한다. 평가는 편집 실행 및 비대상 콘텐츠 보존을 위한 체크리스트 기반 MLLM-as-Judge 방식과 전용 리얼리즘 루브릭(rubric)을 활용하며, 교차 모달, 비디오, 오디오 품질에 대한 자동화된 지표들을 보완적으로 사용한다 [cite: 1, Figure 2].

또한, 본 논문은 AVE-Compass를 통해 식별된 문제들을 해결하기 위해 모듈형 에이전트 프레임워크인 AVE-Agent를 제안한다. [Figure 3]에 나타난 바와 같이, AVE-Agent는 세 가지 에이전트 파이프라인으로 작동한다: 플래너 에이전트(planner agent)는 지시를 종속성 인식(dependency-aware) 하위 작업 DAG(Directed Acyclic Graph)로 분해하고, 실행자 에이전트(executor agent)는 자체 검사(self-check) 반성 루프(reflection loop)를 통해 하위 작업을 실행하며, 혼합 평가자 에이전트(mixed evaluator agent)는 조합된 클립을 평가하고 반복적인 개선을 위한 피드백을 제공한다.

Figure 3: AVE-Agent 프레임워크

Figure 3 — AVE-Agent 프레임워크

AVE-Compass를 사용한 실험 결과는 최신 모델들이 여전히 교차 모달 지시(cross-modal instructions)를 실행하면서 비대상 콘텐츠를 보존하는 데 어려움을 겪고 있음을 보여준다. AVE-Agent는 가장 강력한 편집 실행 성능을 달성하며, Editing Intent 점수 59.8Instruction Following 점수 77.3을 기록하여 Wan2.7(42.4 EI, 69.3 IF) 및 HappyHorse(41.3 EI, 66.9 IF)와 같은 기준선(baselines)을 크게 능가한다 [cite: 1, Table 2]. 특히, AVE-Agent는 오디오 측면의 지시 이행(50.2 Audio IF)과 오디오-비디오 동기화에서 큰 개선을 보여준다 [cite: 1, Table 2, Table 3]. 제거 연구(ablation study)는 플래너 측 프롬프트 향상(planner-side prompt enhancement)평가자 주도 재시도 정제(evaluator-driven retry refinement)가 각각 Editing Intent7.768.75 포인트 향상시키는 중요한 구성 요소임을 확인했다 [cite: 1, Figure 6].

4. Conclusion & Impact

본 논문은 기존의 시각 전용 평가 벤치마크를 넘어, 조화로운 오디오-비디오 편집을 발전시키기 위한 포괄적인 벤치마크인 AVE-Compass를 제시한다. 이 벤치마크는 Instruction Following, Fidelity Preserving, Realism, 그리고 Editing Intent에 대한 모델의 능력을 체계적으로 진단하는 프레임워크를 제공하며, MLLM-as-Judge 방식과 자동화된 지표를 결합한다. 제안된 AVE-Agent 프레임워크는 구조화된 작업 계획(structured task planning) 및 반복적인 자체 반성(iterative self-reflection)을 통해 식별된 모델의 한계점을 해결하고, 특히 복잡한 교차 모달 작업에서 우수한 편집 성능을 달성한다. 이 연구는 학계 및 산업계에서 미래의 오디오-비디오 편집 모델이 더욱 물리적으로나 지각적으로 일관된 멀티모달 콘텐츠 생성을 지향하도록 이끌 것으로 기대된다.

Figure 1: AVE-Compass 개요

Figure 1 — AVE-Compass 개요

Figure 2: 데이터셋 통계

Figure 2 — 데이터셋 통계

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글