[논문리뷰] iFAN: Inference-Aware Learning for Plain Mask Transformers본 논문은 현대의 query-based mask transformer가 가진 추론 과정의 불일치 문제를 해결하기 위해 iFAN(Inference-Aware Learning)을 제안합니다 .#Review#Mask Transformers#Inference-Aware Learning#Query-based Segmentation#APMR#CLSD#Self-Distillation#Computer Vision2026년 8월 11일댓글 수 로딩 중
[논문리뷰] Multi-Task Multi-Frame Visual Piano Transcription본 논문은 오디오 기반 AMT가 서스테인 페달로 인해 발생하는 물리적 건반 상태와 실제 소리 종료 시점 간의 괴리 문제를 해결하고자 하는 시도에서 출발합니다. 기존의 오디오 시스템은 페달로 인해 연주 종료가 지연되어 실제 물리적 키 릴리즈를 반영하지 못하는 한계가 있습니다.#Review#Visual Piano Transcription#Multi-task Learning#Conformer#MIDI Transcription#Computer Vision#Key Mechanics2026년 8월 4일댓글 수 로딩 중
[논문리뷰] GNM Head: A Generative aNthropometric Model of the human head본 논문은 기존의 3DMM들이 가진 해부학적 폐쇄성 문제를 해결하고자 합니다. 기존의 모델들(예: FLAME, BFM)은 인간의 머리를 속이 빈 껍데기 형태로 간주하여 치아나 혀 같은 중요한 내부 기관을 생략해 왔습니다. 이러한 구조적 한계는 생성형 AI나 실시간 렌더링 시 시각적 품질을 저하시키는 원인이 됩니다.#Review#3D Morphable Model (3DMM)#Human Head#Parametric Model#Computer Vision#Neural Rendering#Facial Reconstruction#Anatomy2026년 7월 27일댓글 수 로딩 중
[논문리뷰] Vision as Unified Multimodal Generation본 논문은 기존 컴퓨터 비전 분야가 각 작업(task)별로 최적화된 아키텍처와 독립적인 손실 함수(loss function)를 사용하는 파편화된 시스템에 의존하고 있다는 문제점을 지적합니다. 이로 인해 다양한 시각적 감독 신호를 통합, 재사용 및 결합하는 데 구조적인 한계가 발생합니다.#Review#Unified Multimodal Generation#Computer Vision#Foundation Models#Instruction Tuning#Dense Prediction#SenseNova-Vision#Multimodal Learning2026년 7월 7일댓글 수 로딩 중
[논문리뷰] Text-Vision Co-Instructed Image Editing본 논문은 기존 이미지 편집 방식이 가진 공간 제어의 불명확성과 의미적 의도의 모호성 문제를 해결하기 위해 제안되었습니다. 기존의 textual instruction-based 모델은 의미적 표현력은 뛰어나지만, 정교한 공간적 제어나 객체의 움직임을 지정하는 데 한계가 있습니다 .#Review#Computer Vision#Diffusion Models#Image Editing#Text-Vision Co-Instruction#Spatial Control#Semantic Editing2026년 6월 16일댓글 수 로딩 중
[논문리뷰] Avatar V: Scaling Video-Reference Avatar Video Generation본 연구는 기존의 아바타 생성 방식이 가진 Generalization 부족과 Efficiency 문제를 해결하기 위해 대규모 데이터 기반의 Scaling 접근 방식을 제안합니다. 기존의 개별 모델 학습 방식은 특정 피사체에 종속되어 있어 다양한 인물과 동작을 일반화하는 데 한계가 있었습니다.#Review#Avatar Generation#Video-Reference#Scaling Law#Diffusion Models#Neural Rendering#Computer Vision2026년 6월 14일댓글 수 로딩 중
[논문리뷰] SceneAligner: 3D-Grounded Floorplan Localization in the Wild본 논문은 대규모 환경 및 상업용 건물의 비정형(in-the-wild) 이미지 컬렉션 내에서 카메라 관측치를 2D floorplan에 로컬라이제이션하는 문제를 다룬다.#Review#Floorplan Localization#3D Foundation Models#Cross-modal Correspondence#Density Map#LoRA#Computer Vision2026년 5월 21일댓글 수 로딩 중
[논문리뷰] Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models본 논문은 CLIP과 같은 대규모 vision-language 모델을 하위 태스크(downstream task)에 맞게 fine-tuning할 때 발생하는 OOD(Out-of-Distribution) 성능 저하 문제를 해결하고자 한다.#Review#CLIP#Sparse Autoencoders#Robust Fine-tuning#Interpretability#Representational Drift#Computer Vision2026년 5월 17일댓글 수 로딩 중
[논문리뷰] MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation최근 multi-reference image generation 시스템은 하나의 이미지 내에서 여러 entity를 세밀하게 제어하는 기능에 대한 기대를 높이고 있다.#Review#Multi-subject Generation#Attribute Misbinding#Image Generation#Benchmark#Evaluation Protocol#Deep Learning#Computer Vision2026년 3월 24일댓글 수 로딩 중
[논문리뷰] EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing기존의 Video Object Removal 방법론들은 주로 입력 마스크에 의존하여 객체를 제거하며, 이로 인해 객체가 유발하는 그림자(shadow), 반사(reflection), 변형(deformation)과 같은 복잡한 시각적 부수 효과(side effects)를 제대로 처리하지 못하는 한계가 있습니다 [cite: 1, Figure 2].#Review#Video Object Removal#Video Object Insertion#Diffusion Models#Effect Erasing#Reciprocal Learning#Deep Learning#Computer Vision2026년 3월 19일댓글 수 로딩 중
[논문리뷰] Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels논문은 기존 모노큘러 3D 추적 방식의 한계점(희소한 점만 추적하거나 느린 최적화 기반 dense 추적)을 극복하는 것을 목표로 합니다.#Review#3D Tracking#Dense Scene Flow#Monocular Video#World-centric#Feedforward Model#Deep Learning#Computer Vision#4D Reconstruction2026년 3월 3일댓글 수 로딩 중
[논문리뷰] In Pursuit of Pixel Supervision for Visual Pre-training본 논문은 기존 자기 지도 학습(Self-Supervised Learning) 패러다임이 잠재 공간 목표(latent-space objectives)에 의존하거나 과도한 휴먼 큐레이션을 통해 편향을 도입하는 한계를 지적합니다.#Review#Pixel Supervision#Self-Supervised Learning#Masked Autoencoders (MAE)#Visual Pre-training#Foundation Models#Representation Learning#Web-Scale Data#Computer Vision2025년 12월 17일댓글 수 로딩 중
[논문리뷰] Efficiently Reconstructing Dynamic Scenes One D4RT at a Time논문은 복잡한 동적 장면의 기하학적 구조와 움직임을 비디오로부터 효율적으로 재구성하는 것을 목표로 합니다. 기존의 단편적이고 컴퓨팅 비용이 높은 3D 재구성 접근 방식의 한계를 극복하고, 단일의 통일된 모델로 깊이, 시공간 대응, 전체 카메라 파라미터 추론을 수행하는 4D 이해 프레임워크 를 제시하고자 합니다.#Review#Dynamic Scene Reconstruction#4D Reconstruction#Point Tracking#Transformer Architecture#Feedforward Model#Query-based Inference#Computer Vision#Geometric Consistency2025년 12월 9일댓글 수 로딩 중
[논문리뷰] YOLO Meets Mixture-of-Experts: Adaptive Expert Routing for Robust Object Detection본 연구는 객체 탐지 분야에서 YOLOv9-T 모델의 성능과 견고성을 향상시키기 위해 새로운 Mixture-of-Experts (MoE) 프레임워크를 제안합니다.#Review#Object Detection#YOLOv9#Mixture-of-Experts#Adaptive Routing#Deep Learning#Computer Vision#Feature Specialization2025년 11월 30일댓글 수 로딩 중
[논문리뷰] Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution본 논문은 기존의 단일(monolithic) VLM(Vision-Language Model)이 가진 정밀성, 결정론적 제어 및 복합적 시각 작업 처리 능력의 한계를 극복하고자 합니다.#Review#Visual Agent#Multimodal Perception#Tool-Augmented LLM#Agentic AI#Visual Reasoning#Computer Vision#Structured Outputs#ReAct Framework2025년 11월 18일댓글 수 로딩 중
[논문리뷰] DiffusionLane: Diffusion Model for Lane Detection기존 앵커 기반 차선 감지 방법론의 고질적인 일반화 능력 부족 과 과적합 문제 를 해결하기 위해, 차선 감지 태스크를 노이즈 제거 확산(denoising diffusion) 과정 으로 재정의하는 확산 모델 기반 프레임워크 를 제안하는 것을 목표로 합니다.#Review#Lane Detection#Diffusion Model#Denoising Diffusion#Hybrid Decoding#Anchor-based#Domain Adaptation#Computer Vision#Generative Models2025년 10월 28일댓글 수 로딩 중
[논문리뷰] Universal Image Restoration Pre-training via Masked Degradation Classification본 논문은 다양한 종류의 이미지 손상(degradation)을 복원하는 단일 모델(universal image restoration)의 성능을 향상시키기 위해, 기존 사전 훈련 방법론의 한계를 극복하고자 합니다.#Review#Universal Image Restoration#Pre-training#Masked Image Modeling#Degradation Classification#Deep Learning#Computer Vision#Self-supervised Learning#Low-level Vision2025년 10월 16일댓글 수 로딩 중
[논문리뷰] Trace Anything: Representing Any Video in 4D via Trajectory Fields본 논문은 비디오의 동적 장면을 모델링하고 이해하는 데 필수적인 효과적인 시공간 표현 문제를 해결하고자 합니다.#Review#4D Video Representation#Trajectory Fields#Neural Networks#Spatio-temporal Modeling#3D Point Tracking#Motion Forecasting#Computer Vision#B-splines2025년 10월 16일댓글 수 로딩 중
[논문리뷰] What If : Understanding Motion Through Sparse Interactions논문은 물리적 장면의 동역학을 이해하는 것을 목표로 하며, 특히 국부적인 상호작용('pokes')의 결과로 발생할 수 있는 잠재적인 변화의 다중 모드 분포 를 예측하고자 합니다.#Review#Motion Understanding#Sparse Interactions#Multimodal Prediction#Flow Poke Transformer#Physical Scene Dynamics#Uncertainty Quantification#Generative Models#Computer Vision2025년 10월 15일댓글 수 로딩 중
[논문리뷰] SpaceVista: All-Scale Visual Spatial Reasoning from mm to km본 논문은 기존 공간 추론 모델들이 실내 3D 스캔 및 수동 어노테이션에 의존하고 개별 장면에 과적합되는 한계를 극복하여, mm부터 km까지 아우르는 모든 스케일에서의 시각 공간 추론(All-Scale Visual Spatial Reasoning) 능력을 발전시키는 것을 목표로 합니다.#Review#Spatial Reasoning#Multi-Scale Vision#MLLM#Dataset#Scale Experts#Reinforcement Learning#Computer Vision#Robotics2025년 10월 13일댓글 수 로딩 중
[논문리뷰] VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction기존 Feed-Forward 3D Gaussian Splatting (3DGS) 방식의 문제점인 픽셀 정렬(pixel alignment) 의존성, 뷰 편향된 밀도 분포, 그리고 정렬 오류를 해결하는 것을 목표로 합니다. 특히 입력 뷰 수에 대한 의존성과 저텍스처 또는 폐색 영역에서의 한계를 극복하고자 합니다.#Review#3D Gaussian Splatting#Novel View Synthesis#Voxel-Aligned Prediction#Feed-Forward Reconstruction#Multi-View Consistency#Scene Representation#Computer Vision2025년 9월 24일댓글 수 로딩 중
[논문리뷰] WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool본 연구는 기존 온라인 3D 재구성 방법들이 겪는 재구성 품질과 실시간 성능 간의 절충 문제를 해결하고, 스트리밍 이미지로부터 정밀한 카메라 포즈와 고품질의 포인트 맵을 실시간으로 예측 하는 모델 WinT3R 를 제안하는 것을 목표로 합니다.#Review#Online 3D Reconstruction#Camera Pose Estimation#Streaming Reconstruction#Sliding Window#Camera Token Pool#Real-time Performance#Computer Vision2025년 9월 8일댓글 수 로딩 중
[논문리뷰] Local Scale Equivariance with Latent Deep Equilibrium Canonicalizer본 논문은 컴퓨터 비전에서 발생하는 객체의 지역적 스케일 변화 문제를 해결하고, 모델의 지역적 스케일 일관성(local scale consistency) 을 향상시키는 것을 목표로 합니다.#Review#Scale Equivariance#Deep Equilibrium Models#Canonicalization#Computer Vision#Image Classification#Semantic Segmentation#Latent Representation#Monotone Scaling2025년 8월 21일댓글 수 로딩 중
[논문리뷰] RPCANet++: Deep Interpretable Robust PCA for Sparse Object Segmentation본 논문은 기존의 Robust PCA (RPCA) 모델이 가진 높은 계산 비용, 수동 튜닝에 따른 일반화 능력 부족, 그리고 경직된 사전 지식으로 인한 한계를 극복하는 것을 목표로 합니다.#Review#Robust PCA#Deep Unfolding#Sparse Segmentation#Interpretability#Image Decomposition#Computer Vision2025년 8월 8일댓글 수 로딩 중
[논문리뷰] MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes기존 VOS(Video Object Segmentation) 데이터셋들이 실제와 동떨어진 고립되고 눈에 띄는 객체에 치우쳐 있어 모델의 현실 적용성을 제한하는 문제를 해결하고자 합니다.#Review#Video Object Segmentation#Dataset#Complex Scenes#Benchmark#Object Tracking#Computer Vision#Dataset Challenges2025년 8월 8일댓글 수 로딩 중