[논문리뷰] WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
링크: 논문 PDF로 바로 열기
본 논문은 대규모 그룹 이미지 생성 시 발생하는 ID 보존 및 정렬 문제를 해결하기 위해 WithEveryone 프레임워크를 제안한다.
메타데이터
저자: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-Gang Jiang
1. Key Terms & Definitions
- ID Representation Forcing: 각 ID 토큰이 생성 과정 전반에 걸쳐 유지되도록, 이미지 합성 이전에 각 참조 ID와 정렬된 표현(representation)을 예측하도록 강제하는 기법입니다.
- Layout-Grounded ID Loss (LG-ID Loss): 기존의 불안정한 embedding-based face matching 대신, 레이아웃 주석(annotation)에 기반하여 생성된 얼굴 영역과 참조 ID를 직접 정렬하는 손실 함수입니다.
- Layout CoT (Chain of Thought): 이미지 생성 이전에 모델이 autoregressive 방식으로 인물 위치, 크기, 포즈, ID 결합 정보를 포함한 구조화된 레이아웃을 계획하는 방식입니다.
2. Motivation & Problem Statement
본 논문은 5~10명의 다수 인물이 포함된 그룹 이미지 생성 시 ID 보존 및 일관성이 크게 저하되는 문제를 해결하고자 한다. 기존 모델들은 인원수가 증가함에 따라 개별 ID 신호가 희석되거나, 복제된 얼굴(copy-paste) 오류, 혹은 ID 혼선 현상이 발생하는 한계가 있다. 또한, 기존의 identity loss는 소수 인원 생성에만 최적화되어 있어, 다수의 얼굴 중 참조 ID와 생성된 얼굴을 매칭하는 과정에서의 노이즈가 오히려 학습을 방해한다. 따라서, 생성 전 레이아웃 계획과 명시적인 ID 그라운딩을 통합한 새로운 접근 방식이 필요하다 [Figure 1].

Figure 1 — WithEveryone 아키텍처 개요
3. Method & Key Results
저자들이 제안하는 WithEveryone은 입력된 참조 ID를 ID token으로 변환하고, Layout CoT를 통해 공간적 구성을 계획한 뒤, LG-ID Loss를 사용하여 ID를 정밀하게 생성하는 통합 프레임워크이다 [Figure 3]. 모델은 먼저 참여 ID를 결정하고, 구조화된 레이아웃을 생성한 뒤, 이를 조건으로 이미지 Flow Matching을 수행한다. 특히 LG-ID Loss는 인물 영역을 레이아웃 주석으로 고정하여 매칭 실패를 원천 차단하며, 이는 성능 향상의 가장 핵심적인 요소로 확인되었다 [Table 2]. 실험 결과, WithEveryone은 GPT-Image 2와 비교하여 Sim(Tgt) 지표에서 0.499를 기록하며 우위를 점했고, Copy-Paste 아티팩트는 0.169에서 0.055로 대폭 감소시켰다. 또한 97.3%의 ID 커버리지와 2.8%의 낮은 중복률(Dup)을 달성하며 다인원 그룹 생성의 확장성을 입증하였다 [Table 1].

Figure 3 — 전체 파이프라인 구조
4. Conclusion & Impact
본 연구는 통합된 멀티모달 프레임워크 내에서 계획(planning)과 정렬(grounding)을 결합함으로써 대규모 그룹 이미지 생성의 난제를 효과적으로 극복하였다. 제안된 LG-ID Loss와 Layout CoT는 생성 모델의 공간적 제어력과 ID 충실도를 동시에 향상시켰다. 본 연구는 향후 복잡한 다인원 시나리오를 요구하는 생성형 AI 시스템 설계에 있어 중요한 방법론적 토대를 제공하며, 산업계 및 학계의 ID 보존 이미지 생성 연구 방향에 새로운 기준을 제시한다.
Part 2: 중요 Figure 정보

Figure 1 — WithEveryone 아키텍처 개요

Figure 3 — 전체 파이프라인 구조

Table 1 — 모델 간 정량적 비교
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
- [논문리뷰] GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
- [논문리뷰] Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
- [논문리뷰] TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
- [논문리뷰] Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Review 의 다른글
- 이전글 [논문리뷰] Towards Quantifying Benchmark Optimization in ASR Models
- 현재글 : [논문리뷰] WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- 다음글 [논문리뷰] AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale
댓글