[논문리뷰] S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence본 논문은 기존 VLM들이 정적인 단일 프레임 관찰에 의존하여 연속적이고 진화하는 3D 환경에서의 공간 추론에 한계를 보인다는 점을 해결하고자 합니다 . 기존 모델들은 파편화된 2D 시각 정보에 의존하기 때문에 공간적 일관성(spatial consistency) 유지와 고도화된 3D 기하학적 이해가 어렵습니다.#Review#Spatial Intelligence#Vision-Language Models (VLM)#Agentic Paradigm#Spatio-Temporal Reasoning#Tool-Use#Spatial Evidence Accumulation2026년 6월 18일댓글 수 로딩 중
[논문리뷰] VIBE: Visual Instruction Based Editor본 논문은 기존의 대규모 및 고비용 이미지 편집 모델의 한계를 극복하고, 오픈소스 기반의 초고속, 컴팩트한 시각적 지시 기반 이미지 편집 시스템을 개발하는 것을 목표로 합니다.#Review#Instruction-Based Image Editing#Diffusion Models#Vision-Language Models (VLM)#Model Efficiency#Multi-stage Training#Preference Alignment#Source Consistency2026년 1월 15일댓글 수 로딩 중