[논문리뷰] Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains본 논문은 현재의 비디오 생성 모델들이 시각적 사실성(visual realism)은 향상되었으나, 과학적 메커니즘이나 인과적 법칙을 정확히 반영하는지 검증하기 어렵다는 문제점을 제기한다.#Review#Video Generation#Scientific Reasoning#Benchmark#Evaluation Protocol#Mechanistic Fidelity#MLLM-as-Judge2026년 8월 10일댓글 수 로딩 중
[논문리뷰] AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities본 논문은 지시 기반(instruction-based) 비디오 편집 모델의 평가에 있어 중요한 격차를 해결하고자 한다. 특히, 오디오와 시각 신호가 밀접하게 결합된 실제 비디오를 다루는 모델의 능력 평가에 초점을 맞춘다.#Review#Audio-Video Editing#Holistic Evaluation#Benchmark#MLLM-as-Judge#Fidelity Preserving#Instruction Following#Realism#AVE-Agent2026년 8월 5일댓글 수 로딩 중