[논문리뷰] FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders
링크: 논문 PDF로 바로 열기
I have browsed the paper. Now I need to extract the information required for the summary.
**Metadata:**
* **Authors:** Hongyang Du, Yunfei Xie, Junjie Ye, Jiawei Yang, Xiaoyan Cong, Haodong Zhang, Yongchao Huang, Haiyu Wu, Zongxia Li, Shihang Gui, Dawei Liu, Runhao Li, Jingcheng Ni, Chen Wei, Randall Balestriero, Yue Wang
* **Keywords:** I will select 5-8 keywords after reading the paper in detail.
* Representation Autoencoders (RAEs)
* Layer Fusion
* Reconstruction-Generation Gap
* Randomized Fusion
* Diffusion Models
* DINOv3-L
* Disagreement Regularization
* Image Generation
**Part 1: 요약 본문**
**## 1. Key Terms & Definitions (핵심 용어 및 정의)**
* **Representation Autoencoders (RAEs)**: Pretrained visual encoder의 Feature를 reconstruction 및 diffusion latent로 재사용하여 강력한 시각적 표현을 이미지 생성에 통합하는 모델.
* **Layer Fusion**: Visual encoder의 여러 계층 Feature를 단일 Latent space로 결합하는 방식.
* **Reconstruction-Generation Gap**: RAE에서 Decoder의 재구성 목표(pixel details)와 Generator의 생성 목표(generation metrics)가 선호하는 encoder layer의 정보가 달라 발생하는 성능 불일치 현상.
* **FuseReg**: 고정된 Layer fusion 대신 Encoder layer의 Random subsets을 학습에 활용하여 Layer-fusion robustness를 개선하고 Reconstruction-Generation Gap을 완화하는 정규화 기법.
* **Drop Rate (p)**: Random subset sampling에서 각 Layer가 제외될 확률을 제어하는 파라미터. Decoder와 DiT에 각각 `p_dec` 및 `p_dit`로 적용된다.
**## 2. Motivation & Problem Statement (연구 배경 및 문제 정의)**
Representation Autoencoders (RAEs)는 Pretrained visual encoder의 Feature를 활용하여 이미지 생성 모델에 강력한 시각적 표현을 통합하지만, Latent space를 형성할 Encoder layer 선택에서 Trade-off에 직면한다. 기존 RAE 모델인 RAEv2는 마지막 `k`개의 Encoder layer를 고정된 방식으로 Fusing하는데, 얕은 Layer는 Pixel detail 보존에 유리한 반면 깊은 Layer는 생성 품질(Generation metrics)에 더 나은 결과를 제공한다. 이처럼 재구성(Reconstruction)과 생성(Generation)이라는 두 가지 예측 문제가 서로 다른 정보에 이점을 가지므로, 단일한 고정 Layer fusion 방식은 Decoder와 Generator를 동일한 선택에 묶어 전체 파이프라인의 품질과 유연성을 제한하는 문제를 야기한다. 특히 Figure 1에서 볼 수 있듯이, 학습 가능한 게이트는 얕은 Layer로 Collapse되어 깊은 Layer의 중요도가 감소하는 현상이 발생하며, 이는 Latent preference의 차이, 즉 Reconstruction-Generation Gap을 심화시킨다.
**## 3. Method & Key Results (제안 방법론 및 핵심 결과)**
본 논문은 FuseReg를 제안하여 휴리스틱한 Feature selection 대신 Encoder layer의 Random subsets을 활용한 학습으로 Decoder와 Generator의 Layer-fusion robustness를 강화한다. FuseReg는 학습 중 Encoder layer의 Random subsets으로 구성된 정규화된 Latent를 Sampling하고, Decoder는 이를 Pixel로 재구성하도록, Diffusion Transformer (DiT)는 노이즈가 추가된 Subset fusion으로부터 Full-layer representation을 예측하도록 학습된다. 이론적으로, Subset sampling은 Cross-layer disagreement에 대한 Sensitivity를 명시적으로 페널티화하며, 이는 Mean-preserving하면서도 Layer disagreement 방향으로 Variation을 추가하여 정규화 효과를 제공한다. Decoder(`p_dec`)와 DiT(`p_dit`)에 대해 별도의 Drop Rate를 도입하여 각 예측 문제에 최적화된 정규화 강도 조절을 가능하게 한다.
실험 결과, FuseReg는 DINOv3-L encoder와 ImageNet-256 데이터셋에서 우수한 성능을 입증했다. Table 1에 따르면, 단일 FuseReg Decoder(p=0.95)는 고정 Fusion에 특화된 RAEv2 Decoder 대비 `k=7`, `k=23`, `ℓ11` 세 가지 Fusion 모두에서 강력한 Reconstruction 성능을 유지하여, PSNR이 각각 **23.77dB**, **27.52dB**, **25.13dB**를 달성했으며, rFID는 **0.6** 미만을 기록했다. 이는 RAEv2 Decoder가 특정 Training fusion 외에서는 크게 성능이 저하되는 것과 대조된다. Figure 2는 FuseReg Decoder가 다양한 Fusion에도 불구하고 Feature map에서 안정적인 Spatial structure를 유지함을 보여준다. 또한, Decoder 교체만으로도 Unchanged RAEv2 DiT-XL Generator의 Unguided gFID를 **3.01**에서 **2.21**로 **27%** 감소시켰다. DiT-Base에서는 Decoder와 Generator의 Joint regularization을 통해 Unguided gFID를 **13.96**에서 **9.93**으로 **29%** 추가 감소시켜, 두 Stage의 정규화가 상호 보완적인 이점을 제공함을 확인했다.
**## 4. Conclusion & Impact (결론 및 시사점)**
본 논문은 Representation Autoencoders (RAEs)에서 Layer fusion을 훈련 분포로 다루는 FuseReg를 제안하여 Reconstruction-Generation Gap을 효과적으로 완화한다. 정규화된 Random subsets을 Sampling하는 기법은 Full-layer latent를 평균적으로 보존하면서도 Cross-layer disagreement 방향으로 Variation을 유도하며, 이는 선형 모델에서 명시적인 Disagreement penalty를 부과하는 효과를 가져온다. FuseReg를 통해 훈련된 단일 Decoder는 Full, Sparse, Single-layer fusions에 걸쳐 견고한 Reconstruction 성능을 보여주며, Decoder만 교체해도 기존 Generator의 생성 품질이 크게 향상됨을 입증했다. Generator 훈련에도 동일한 원리를 적용하여 Stage별로 독립적으로 Drop Rate를 설정함으로써 상호 보완적인 생성 성능 개선을 달성했다. 이 연구는 Downstream model이 특정 Layer composition에 의존하는 문제를 해결함으로써 Pretrained encoder를 수정하지 않고도 Decoder-Generator Interface를 개선하는 효과적인 방법을 제시한다.
> ⚠️ **알림:** 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] LLMs4All: A Review on Large Language Models for Research and Applications in Academic Disciplines
- [논문리뷰] ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker
- [논문리뷰] VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
- [논문리뷰] TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations
- [논문리뷰] Tactile-JEPA: Topology-Aware Self-Supervised Representation Learning for Distributed Tactile Sensors
Review 의 다른글
- 이전글 [논문리뷰] FoMo: Forking Moment in Generative Trajectory as a Perceptual Distance
- 현재글 : [논문리뷰] FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders
- 다음글 [논문리뷰] Game Arena: Strategic LLM Evaluation in Competitive Environments
댓글