[논문리뷰] Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
링크: 논문 PDF로 바로 열기
저자: Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han
1. Key Terms & Definitions (핵심 용어 및 정의)
- Sol-Attn: 훈련 없이(training-free) 비디오 생성 추론을 가속화하는, 동적 라우팅 및 근사 계산이 통합된 Sparse Attention 기법입니다.
- On-the-fly Block Thresholding: 사전에 전체 proxy map을 생성하지 않고, online softmax 수행 중 실시간으로 block proxy score와 임계값을 비교하여 중요한 block을 선택하는 방식입니다.
- Proxy-score Reuse: 임계값 이하의 block에 대해 proxy score를 단순히 삭제하지 않고 재사용하여 근사 보정을 수행, dense attention과의 오차를 줄이는 기법입니다.
- Online Softmax: 전체 attention 행렬을 HBM에 생성하지 않고, tiled computation을 통해 on-chip에서 연산을 처리하는 효율적인 방법론입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 대규모 비디오 생성 모델에서 긴 토큰 시퀀스로 인해 발생하는 quadratic complexity의 self-attention 병목 현상을 해결하고자 합니다. 기존의 block-sparse attention 방식은 고정된 budget을 사용하는 Rigid routing 문제와 attention mass를 무시하고 block을 통째로 삭제하는 Lossy keep-or-drop 문제로 인해 효율성과 정확성 사이에서 한계를 보입니다. 특히, 대다수 기법이 sparse attention 시작 전 전체 proxy map을 HBM에 생성해야 하므로 상당한 오버헤드가 발생하며, 이는 긴 시퀀스 환경에서 성능 개선을 저해합니다. 이러한 문제를 극복하기 위해 저자들은 별도의 라우팅 단계 없이 단일 연산 커널 내에서 동적 버짓 조절과 근사 보정을 통합하는 솔루션을 제안합니다.
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문이 제안하는 Sol-Attn은 Query-dependent thresholding, On-the-fly sparsification, Proxy-score reuse 세 단계의 메커니즘을 통해 성능을 극대화합니다. 첫째, 각 쿼리 블록에 대해 데이터 통계량 기반의 동적 임계값을 사용하여 유연한 버짓을 확보합니다. 둘째, 온라인 소프트맥스 과정에서 이 임계값을 실시간 적용하여 불필요한 연산을 즉시 생략하는 Nested-loop 구조를 설계하였습니다 [Figure 4]. 마지막으로 버려지는 블록의 정보를 Taylor expansion 기반으로 근사하여 보정함으로써 정확도 저하를 최소화합니다. 실험 결과, Sol-Attn은 Wan2.1, HunyuanVideo, LTX 2.3 등 최신 비디오 생성 모델에서 우수한 성능을 입증하였습니다. 정량적으로는 비디오 생성 및 편집 작업에서 각각 최대 2.1배 및 2.3배의 End-to-End Speedup을 달성하였으며, Sol-Engine과 결합 시 최대 5배 이상의 가속을 기록했습니다 [Table 1, Table 3]. 특히, 기존 방식인 Top-k나 Top-p 라우팅 대비 선택 지연 시간이 11.5배에서 32.7배 더 빠르다는 점이 확인되었습니다 [Figure 5].

Figure 4 — Sol-Attn의 핵심 알고리즘 구조인 Nested-loop 커널을 보여주는 다이어그램

Figure 5 — 기존 방식 대비 라우팅 속도와 메모리 효율성을 보여주는 정량적 비교 결과
4. Conclusion & Impact (결론 및 시사점)
본 논문은 비디오 생성 추론 시 라우팅을 독립적인 전처리 과정에서 제외하고 단일 스트리밍 연산으로 통합함으로써, 정확도와 효율성의 트레이드오프를 획기적으로 개선했습니다. 제안된 Sol-Attn은 별도의 훈련이 필요 없는 가벼운 커널로, 다양한 확산 모델에 즉각적으로 적용 가능한 실용적인 솔루션을 제시합니다. 본 연구의 접근 방식은 향후 긴 컨텍스트를 다루는 비디오 생성 및 편집 도구의 표준 가속 라이브러리로 활용될 가능성이 높으며, 고해상도 생성 모델의 상용화를 앞당기는 중요한 기점이 될 것입니다.

Table 1 — 주요 비디오 생성 모델 대상 성능 및 효율성 벤치마크 결과
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Motion4Motion: Motion Transfer Across Subjects at Inference
- [논문리뷰] OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data
- [논문리뷰] OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning
- [논문리뷰] Coarse-Guided Visual Generation via Weighted h-Transform Sampling
- [논문리뷰] Helios: Real Real-Time Long Video Generation Model
Review 의 다른글
- 이전글 [논문리뷰] Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- 현재글 : [논문리뷰] Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
- 다음글 [논문리뷰] StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
댓글