본문으로 건너뛰기

[논문리뷰] CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

링크: 논문 PDF로 바로 열기

메타데이터

저자: Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park


1. Key Terms & Definitions (핵심 용어 및 정의)

  • VIP-Seg (Visual-Instance-Prompt Segmentation): 참조 이미지(Support Image)의 특정 객체 인스턴스를 쿼리 이미지(Query Image) 내에서 정확히 식별하고 분할하는 작업으로, 카테고리 수준이 아닌 인스턴스 수준의 정밀한 분할을 목표로 함.
  • CtrlVTON (Controllable Virtual Try-On): 가상 착장(Virtual Try-On) 문제를 고정된 마스크 기반의 Inpainting이 아닌, 유연한 Image Editing 관점에서 접근하여 의류의 스타일, 크기, 공간적 배치를 세밀하게 조절하는 프레임워크.
  • VIP-SAM: VIP-Seg 문제를 해결하기 위해 제안된 모델로, 참조 이미지의 특징을 인코더 중간 단계에 주입(Cross-attention)하여 Query Encoder를 조건부로 제어하는 아키텍처 [Figure 2].
  • Task Tokens: 의류 교체 시 모델이 수행할 동작(full_swap, partial_swap, add 등)을 결정하는 조건부 입력값으로, 단일 혹은 다중 의류 착장 시 시맨틱한 제어를 가능하게 함.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존 가상 착장(VTO) 시스템이 의류의 스타일, 크기, 공간적 배치와 같은 사용자 수준의 미세한 제어를 지원하지 못한다는 한계를 해결하고자 한다. 기존의 Inpainting 기반 방식은 마스크의 경계 모호성으로 인해 의류와 인물의 자연스러운 합성이 어렵고, ID 유지나 다양한 레이어링 구현에 취약점을 보인다 [Figure 1]. 저자들은 이러한 제약에서 벗어나기 위해 VTO를 단순한 영역 채우기가 아닌 '이미지 편집(Image Editing)' 문제로 재정의하였다. 특히, 사용자에게 의류 레이아웃에 대한 픽셀 수준의 통제권을 부여하기 위해 새로운 분할 작업인 VIP-Seg를 도입하여 보다 정교한 제어를 실현하고자 한다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 VIP-Seg를 수행하는 VIP-SAM과 이를 통해 픽셀 수준의 제어를 달성하는 CtrlVTON 프레임워크를 제안한다. VIP-SAM은 참조 이미지를 모델의 초기 단계부터 주입하여 쿼리 이미지 인코더가 타겟 인스턴스를 정확히 추적하도록 설계되었으며, 이를 통해 기존 VRP-SAM 기반 방식들이 겪던 중첩되거나 유사한 색상의 의류 분할 문제를 성공적으로 해결한다 [Figure 2]. CtrlVTON은 Inpainting 기반의 제약에서 벗어나, 참조 이미지(Reference Person)를 기반으로 Identity와 Pose를 보존하며 의류를 합성하는 Editing 기반의 프레임워크를 구축한다. 모델은 의류 클래스 토큰과 작업 토큰을 통해 다양한 교체 시나리오를 지원하며, LoRA 어댑터를 통해 분할 마스크를 입력받아 최종 결과물을 미세 조정한다 [Figure 4].

정량적 평가 결과, VIP-SAM은 Fashion-test 데이터셋에서 mIoU 95.8%를 기록하며 기존 방식인 VRP-SAM(94.3%)을 상회하는 성능을 보였다 [Table 1]. 가상 착장 성능 측면에서 CtrlVTON-baseM-DINO 0.8054, GTC 4.2057, PBC 4.7301을 기록하여 기존의 Inpainting 기반 모델들(예: IDM-VTON, CatVTON) 및 편집 기반 모델들보다 월등히 높은 정량적 성능 우위를 입증하였다 [Table 2].

4. Conclusion & Impact (결론 및 시사점)

본 연구는 VIP-Seg를 통해 가상 착장의 공간적 제어 능력을 획기적으로 개선한 CtrlVTON을 제시하였다. 의류 착장을 이미지 편집 문제로 재정의하고 분할 마스크를 제어 인터페이스로 활용함으로써, 복잡한 레이어링과 스타일 조절이 가능해졌다. 이는 향후 패션 이커머스 산업에서 소비자가 실제와 거의 흡사한 수준으로 의류를 입어보고 스타일링할 수 있는 가상 피팅 환경을 제공하는 데 중요한 기술적 토대가 될 것으로 기대된다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글