[논문리뷰] AVA-Encoder: Towards Agent-Native Video Representation Learning본 논문은 기존의 비디오 표현 방식이 에이전트의 복잡한 추론 및 수정 작업에 부적합하다는 문제 의식에서 출발합니다. 기존의 저수준(Pixel/Latent) 표현은 에이전트가 직접 해석하거나 수정하기 어렵고, 텍스트 캡션 기반의 표현은 영화 제작에 필요한 풍부한 구조적 정보를 상실하기 쉽습니다.#Review#Agentic Video Encoder#Knowledge Graph#Video Representation Learning#Textual-Gradient#Self-Evolution#Multimodal Reconstruction2026년 8월 12일댓글 수 로딩 중