본문으로 건너뛰기

[논문리뷰] SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

링크: 논문 PDF로 바로 열기

메타데이터

저자: Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

1. Key Terms & Definitions (핵심 용어 및 정의)

  • Hybrid Linear-Softmax Attention: O(N) 복잡도의 Gated Linear Attention과 O(N²) 복잡도의 Gated Softmax Attention을 특정 비율(3:1)로 결합하여 효율성과 표현력을 동시에 확보하는 메커니즘.
  • Block Attention Residuals (AttnRes): 각 레이어의 출력값을 다음 레이어로 단순히 더하는 방식 대신, completed block의 정보를 공유 및 라우팅하여 레이어 간의 정보 전달 효율을 극대화하고 Effective Rank를 높이는 기법.
  • TQD (Content-aware Flow-shift): 비디오 데이터의 품질과 움직임(Motion) 특성에 따라 Flow Matching의 노이즈 샘플링 단계를 최적화하여 학습 효율을 높이는 전략.
  • Sol-Engine: 커널 퓨전, 캐싱, 희소 어텐션 기술을 포함하여 고해상도 비디오 생성을 가속화하는 최적화 엔진.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 기존의 고해상도 Video DiT 모델들이 사용하는 Full-Softmax Attention의 O(N²) 계산 복잡도로 인해 발생하는 심각한 Latency 및 연산 비용 문제를 해결하고자 한다. 특히 시퀀스 길이가 길어질수록 메모리 소비와 연산량이 기하급수적으로 증가하여 실시간 서비스나 대규모 생성이 어렵다는 한계가 있다. 기존의 순수 Linear Attention 방식은 효율성은 높으나 고차원적인 토큰 간 상호작용을 충분히 표현하지 못하는 Rank Bottleneck 문제가 존재한다. 따라서 저자들은 Linear Attention의 효율성을 유지하면서 Softmax 수준의 표현력을 복구할 수 있는 새로운 하이브리드 아키텍처를 제안한다 [Figure 1].

Figure 1: SANA-Video 2.0 개요 및 Latency 비교

Figure 1 — SANA-Video 2.0 개요 및 Latency 비교

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 Hybrid Linear-Softmax AttentionBlock Attention Residuals (AttnRes)를 결합한 SANA-Video 2.0을 제안한다. Hybrid Attention은 25%의 Softmax Anchor를 삽입하여 Rank 제약을 해소하며, AttnRes는 Completed Block의 요약 정보를 깊은 레이어로 전달하여 Deep-layer Effective Rank를 약 12% 향상시킨다 [Figure 2]. 학습 과정에서는 TQD 및 단계적인 해상도/지속 시간 Curriculum을 적용하여 성능을 최적화하였다. 실험 결과, SANA-Video 2.0은 40-step 샘플링에서 VBench Score 84.30을 기록하며 대규모 Full-Softmax 모델들과 대등한 품질을 보였다. 또한, 720p/60s 설정에서 기존 Full-Softmax 대비 3.2배 빠른 DiT Forward 성능을 달성하였으며, Sol-Engine 최적화 적용 시 최대 120배 빠른 파이프라인 가속을 구현하였다 [Figure 1].

Figure 2: 하이브리드 DiT 레이어 및 AttnRes 구조

Figure 2 — 하이브리드 DiT 레이어 및 AttnRes 구조

4. Conclusion & Impact (결론 및 시사점)

본 연구는 하이브리드 어텐션 설계를 통해 고품질 비디오 생성의 효율성과 확장성을 비약적으로 개선하였다. 제안된 SANA-Video 2.0은 기존 모델 대비 훨씬 낮은 Latency와 컴퓨팅 자원으로도 고해상도 비디오 생성을 가능하게 함으로써 연구 및 산업계의 실용성을 대폭 증대시켰다. 특히, 선형 어텐션의 확장성(Scalability)과 어텐션 레지듀얼의 표현력을 효과적으로 결합한 본 아키텍처는 향후 다양한 시퀀스 모델링 문제의 핵심적인 기술적 이정표가 될 것으로 기대된다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글