[논문리뷰] LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
링크: 논문 PDF로 바로 열기
메타데이터
저자: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang
1. Key Terms & Definitions (핵심 용어 및 정의)
- Diffusion Transformer (DiT): 영상 생성 및 애니메이션 작업을 위한 대규모 파라미터 기반의 딥러닝 백본 아키텍처입니다.
- Reference-Anchored Teacher-Forcing Adaptation: 사전 학습된 양방향 DiT를 블록 단위의 인과적(causal) 생성기로 변환하여, 참조 이미지의 정보를 생성 과정 전반에 유지하도록 학습시키는 기법입니다.
- Pose-Retrieval Sink Attention (PR-Sink): 한정된 KV-cache 용량 내에서 장기적인 시간적 일관성을 유지하기 위해 정적(Static) Sink, 동적(Dynamic) Sink, 롤링 윈도우를 결합한 메모리 관리 메커니즘입니다.
- Block-wise Self-Forcing Distillation: 다단계 추론 과정을 소수의 step(3단계)으로 압축하여 실시간 생성을 가능하게 하고, 모델 스스로의 예측을 학습에 활용해 오차 누적을 줄이는 증류 기법입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 기존의 pose-driven human animation 시스템들이 지닌 실시간성 결여와 장기 생성 시의 품질 저하 문제를 해결하기 위해 LiveAnimate를 제안한다. 기존의 대규모 모델(14B-parameter DiT 기반)은 비디오 생성 품질은 우수하나, 오프라인 환경에서 생성에 수 분에서 수 시간이 소요되어 라이브 스트리밍이나 가상 아바타와 같은 대화형 애플리케이션에 적용하기 어렵다. 또한, 고정된 길이의 클립 생성에 최적화되어 있어, 스트리밍 환경에서 요구되는 무제한 길이의 생성 시 정체성(Identity) 및 외형(Appearance)의 drift(표류) 문제가 발생한다는 한계가 있다 [Table 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 14B 파라미터의 causal DiT 기반 시스템인 LiveAnimate를 통해 실시간 스트리밍 환경에서 안정적인 장기 생성을 구현한다 [Figure 2]. 저자들은 두 단계의 학습 파이프라인을 설계하였는데, 1단계에서는 참조 이미지와 ground-truth를 활용해 블록 인과적 생성기를 구축하고, 2단계에서는 3-step의 고속 추론이 가능하도록 Block-wise Self-Forcing Distillation을 수행하였다. 장기적 일관성을 보장하기 위해 도입된 PR-Sink는 고정된 크기의 KV-cache를 유지하면서도, 정적/동적 Sink를 통해 참조 이미지 정보와 특정 포즈에 부합하는 과거 프레임 정보를 효율적으로 복원한다. 실험 결과, 2개의 NVIDIA H100 GPU 환경에서 19.63 FPS의 성능을 달성하였다 [Table 2]. 특히 3분 분량의 벤치마크 테스트에서 기존 모델들은 시간이 지남에 따라 IQA나 DINO-S 지표가 급격히 하락하는 반면, LiveAnimate는 초기 30초 대비 마지막 분까지 IQA 수치를 거의 일정하게(4.047 vs. 4.026) 유지하며 뛰어난 안정성을 입증하였다 [Figure 3, Figure 5].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 실시간성이 보장되는 14B 규모의 causal DiT 기반 스트리밍 human animation 시스템인 LiveAnimate를 성공적으로 제시하였다. 학습 효율성과 실시간 추론을 동시에 달성한 이 연구는 향후 라이브 스트리밍, 원격 회의(telepresence), 가상 아바타 분야에서 고품질의 실시간 상호작용을 구현하는 데 핵심적인 기여를 할 것으로 기대된다. 또한, 메모리 사용량과 지연 시간이 스트리밍 길이에 독립적이라는 점은 자원이 제한된 환경에서도 안정적인 서비스를 제공할 수 있는 기반이 된다.
Part 2: 중요 Figure 정보

Figure 2 — LiveAnimate 전체 파이프라인

Figure 3 — 전신 생성 비교 결과

Figure 5 — 3분 롤아웃 품질 지표 추이
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration
- [논문리뷰] UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
- [논문리뷰] AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
- [논문리뷰] MiniWorld: Democratizing the Training of Video World Models from Scratch
- [논문리뷰] SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
Review 의 다른글
- 이전글 [논문리뷰] LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
- 현재글 : [논문리뷰] LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
- 다음글 [논문리뷰] LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation
댓글