[논문리뷰] Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding기존의 MLLM 기반 STVG 모델들은 영상 내 객체의 이동 궤적(Trajectory)을 Autoregressive 방식으로 순차 생성하는데, 이는 Tube 길이가 길어질수록 Decoding Latency가 선형적으로 증가하고, 이전 시점의 위치 정보 오류가 다음 시점으로 전파되는 문제를 야기한다.#Review#Spatio-Temporal Video Grounding#Parallel Tube Decoding#Decoupled Block Attention#Localization-Aware Policy Optimization#Multimodal Large Language Models2026년 8월 30일댓글 수 로딩 중