[논문리뷰] Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation본 논문은 비디오 데이터의 강한 시공간적 중복성(Spatio-temporal redundancy)을 기존 VAE가 효율적으로 활용하지 못한다는 문제에서 출발합니다. 기존 OmniTokenizer와 같은 고정 길이 토큰화 방식은 영상의 복잡도와 무관하게 고정된 압축 비율을 사용하여 연산 자원을 낭비합니다.#Review#VAE#Adaptive Tokenization#Video Diffusion Model#Token Sparsity#Cascaded Generation#Spatio-temporal Redundancy2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Articulated Object Reconstruction from Rest-State Observation본 논문은 움직임 정보가 부재한 닫힌 상태의 관측으로부터 다중 파트 articulated 객체를 정확하게 재구성하는 Rest2Art 프레임워크를 제안합니다 . 기존 연구들은 주로 여러 관절 상태를 직접 관측하거나 사전 학습된 데이터에 의존하는 등, 정적인 단일 관측 환경에서는 정확도가 떨어지는 한계가 있습니다 .#Review#Articulated Object#Rest-State Reconstruction#Mesh Segmentation#Video Diffusion Model#Digital Twin#Joint Parameter Estimation2026년 8월 11일댓글 수 로딩 중
[논문리뷰] OpenLongTail: Generative Scaling of Long-Tail Driving Data본 논문은 자율주행 VLA 모델의 long-tail 시나리오 대응 능력을 향상시키기 위한 데이터 확보 문제를 해결하고자 한다.#Review#Autonomous Driving#Video Diffusion Model#VLA Model#Generative Data Engine#Extrapolative View Synthesis2026년 7월 20일댓글 수 로딩 중
[논문리뷰] AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model본 논문은 임의의 불규칙한 Sparse-view로부터 고품질의 대규모 3D 장면을 복원하는 문제를 해결하고자 합니다. 기존의 확산 모델 기반 연구들은 소수의 참조 뷰에만 의존하거나, 3D 기하학적 정보를 명시적으로 통합하지 못해 복잡한 장면에서 일관성을 유지하는 데 한계가 있습니다.#Review#3D Reconstruction#Video Diffusion Model#Sparse-view#Geometry-Aware#Global Scene Memory2026년 4월 21일댓글 수 로딩 중
[논문리뷰] FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space본 논문은 기존 비디오 확산 모델의 높은 추론 비용으로 인한 긴 대기 시간과 GPU 비용 문제를 해결하여, 더욱 빠르고 효율적인 비디오 생성을 가능하게 하는 고속 이미지-투-비디오 (I2V) 확산 프레임워크인 FSVideo 를 개발하는 것을 목표로 합니다.#Review#Video Diffusion Model#Image-to-Video Generation#Latent Space Compression#Diffusion Transformer (DiT)#Model Acceleration#Layer Memory#Video Upsampling2026년 2월 2일댓글 수 로딩 중
[논문리뷰] SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time본 연구는 단일 모노큘러 비디오 로부터 동적 장면을 공간(카메라 시점)과 시간(모션 시퀀스)에 걸쳐 독립적으로 제어하며 생성적으로 렌더링하는 것을 목표로 합니다.#Review#Video Diffusion Model#Generative Rendering#Novel View Synthesis#Space-Time Disentanglement#Temporal Control#Camera Control#Dynamic Scenes#Temporal Warping2025년 12월 31일댓글 수 로딩 중
[논문리뷰] Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation본 논문은 투명하거나 반사되는 객체에 대한 깊이 및 법선 추정의 고질적인 문제를 해결하고자 합니다.#Review#Video Diffusion Model#Depth Estimation#Normal Estimation#Transparent Objects#Robotics#Data Generation#LoRA Fine-tuning2025년 12월 29일댓글 수 로딩 중
[논문리뷰] Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO이 연구는 기존의 텍스트 기반 다음 이벤트 예측(NEP)의 한계를 넘어, 비디오를 답변으로 제공 하는 새로운 패러다임인 Video-Next-Event Prediction (VNEP) 을 개척합니다.#Review#Video Generation#Next Event Prediction#Reinforcement Learning#Vision-Language Model#Video Diffusion Model#Joint Optimization#Multimodal AI#Procedural Learning2025년 11월 20일댓글 수 로딩 중