[논문리뷰] Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
링크: 논문 PDF로 바로 열기
저자: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu
1. Key Terms & Definitions (핵심 용어 및 정의)
- Any-item Virtual Try-On: 특정 의류 카테고리에 국한되지 않고 상의, 하의, 신발, 가방, 액세서리 등 모든 패션 아이템을 가상으로 착용시켜보는 기술적 태스크.
- Multi-Reference Conditioning: 여러 개의 서로 다른 아이템 이미지(Product shot 또는 In-the-wild photo)를 동시에 입력받아 하나의 타겟 피사체에 조화롭게 합성하는 기술.
- MMDiT (Multimodal Diffusion Transformer): 텍스트 지시사항과 다중 이미지 입력을 효과적으로 결합하여 고해상도 이미지를 생성하는 핵심 생성 엔진 [Figure 6].
- CPT-SFT-RL Pipeline: 논문에서 제안한 3단계 학습 전략으로, Continued Pre-training(CPT), Supervised Fine-Tuning(SFT), Reinforcement Learning(RL)을 통해 모델의 성능을 극대화함.

Figure 6 — Oxygen-TryOn 전체 아키텍처
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존 가상 착용(Virtual Try-On) 시스템이 가진 범용성의 한계와 정밀도 부족 문제를 해결하기 위해 Oxygen-TryOn을 제안한다. 기존 모델들은 주로 상의와 같은 특정 카테고리에 한정되거나, 스튜디오 환경의 깨끗한 제품 이미지만을 처리할 수 있는 제약이 있었다 [Figure 1]. 또한, 대다수의 방법론이 마스크 기반의 Inpainting 방식을 사용하여 복잡한 실제 환경(In-the-wild)에서의 자연스러운 레이어링이나 옷감 변형을 처리하는 데 한계를 보였다 [Figure 3]. 결과적으로, 다양한 패션 아이템을 자유롭게 조합하고 피사체의 정체성과 의류의 미세한 텍스처를 동시에 보존하는 통합된 파운데이션 모델의 부재가 본 연구의 핵심적인 문제 정의이다.

Figure 1 — 모델의 고충실도 착용 예시
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 패션 도메인에 특화된 데이터 엔진과 CPT-SFT-RL이라는 3단계 학습 파이프라인을 도입하여, 이해 기반의 Multi-Reference 생성 모델을 구축하였다. 모델은 JoyAI-Image-Edit 아키텍처를 기반으로 하며, 사용자 지시사항과 여러 참조 이미지를 Multimodal Large Language Model (MLLM)을 통해 해석하고, 이를 MMDiT로 전달하여 고품질의 결과를 생성한다 [Figure 6]. 정량적 평가 결과, Oxygen-TryOn은 기존의 강력한 상업용 모델인 Nano Banana Pro, GPT-Image-2, Seedream5 Lite 및 오픈소스 모델인 FLUX.2를 상회하는 성능을 기록하였다. 특히, 복잡한 다중 아이템 조합과 실제 환경에서의 착용 테스트에서 압도적인 Consistency와 Realism을 달성하였다 [Figure 2]. 제안된 모델은 별도의 Task Switching 없이도 Pose 변경과 같은 일반적인 편집 지시사항을 동일한 패스에서 성공적으로 수행할 수 있는 강점을 지닌다 [Figure 3].

Figure 2 — 다중 아이템 조합 및 편집 능력
4. Conclusion & Impact (결론 및 시사점)
Oxygen-TryOn은 모든 패션 아이템을 아우르는 최초의 통합 파운데이션 모델로서, 기존 가상 착용 기술의 표준을 한 단계 격상시켰다. 본 연구가 제시한 데이터 엔진과 3단계 학습 레시피는 해당 분야 연구자들에게 고성능 모델 구축을 위한 투명하고 재사용 가능한 프레임워크를 제공한다. 향후 본 모델은 온라인 리테일 산업 전반에 걸쳐 사용자의 쇼핑 경험을 혁신하고, 생성형 AI가 실제 상업적 가치를 창출하는 핵심 사례로 자리매김할 것으로 기대된다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
Review 의 다른글
- 이전글 [논문리뷰] OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
- 현재글 : [논문리뷰] Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
- 다음글 [논문리뷰] Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
댓글