[논문리뷰] Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching
링크: 논문 PDF로 바로 열기
메타데이터
저자: Kristian Schwethelm, Daniel Rückert, Georgios Kaissis
1. Key Terms & Definitions (핵심 용어 및 정의)
- Looped Language Models: 동일한 계층(Shared layers)인 Recurrent Core를 반복적으로 실행하여 연산 효율과 파라미터 최적화를 도모하는 언어 모델 아키텍처입니다.
- Depth-adaptive Inference: 토큰마다 모델 내부의 Recurrent Core를 통과하는 루프 횟수($r_t$)를 다르게 하여, 쉬운 토큰은 빠르게, 어려운 토큰은 더 많은 연산을 수행하게 하는 추론 방식입니다.
- Continuous Depth Batching (CDB): 루프 단계(Loop step) 사이마다 배치를 재구성하여, 루프에서 이탈(Exit)한 토큰 자리에 새로운 토큰을 채워 넣어 연산 효율을 극대화하는 스케줄링 기법입니다.
- Prelude / Coda: Recurrent Core 외부에 존재하며 루프 전후로 각각 한 번씩만 실행되는 경계 단계(Boundary stages)를 지칭합니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Looped Language Models가 가진 Depth-adaptive Inference 잠재력을 실질적인 추론 속도 향상으로 전환하는 것을 목표로 합니다. 기존의 표준 배치 처리 시스템(예: vLLM)은 모든 토큰이 동일한 연산 경로를 거쳐야 한다는 전제가 있어, 루프 횟수가 다른 토큰들을 효율적으로 병렬 처리하는 데 한계가 있습니다. 이를 해결하지 못하면 루프를 통한 연산량 감소가 실제 Latency 단축으로 이어지지 않고, 오히려 스케줄링 오버헤드로 인해 성능이 저하됩니다. 본 연구는 이러한 복잡한 동적 배치 문제를 해결하기 위한 시스템적 구현과 설계를 제안합니다 [Figure 1].
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 Continuous Depth Batching (CDB)을 통해 Recurrent Core 단계마다 동적으로 배치를 재구성하는 아키텍처를 제안합니다. 제안된 방법론은 루프에서 이탈하는 토큰을 감지하고 즉시 새로운 토큰을 채워 넣는 Refill 스케줄링과, 경계 단계인 Prelude 및 Coda를 효율적으로 인터리빙하는 메커니즘을 포함합니다. 특히, 루프 단계 이전에 다음 배치를 준비하기 위해 Lookahead gate를 활용하여 GPU 유휴 시간을 최소화하는 비동기적 스케줄링을 구현했습니다 [Figure 3].
실험 결과, Ouro 1.4B 모델에서 CDB를 사용했을 때 기존 Fixed-depth CB(Continuous Batching) 대비 최대 1.53배의 Throughput 향상을 달성하며, 이론적 최대 속도 향상의 99%를 실현했습니다. 또한, Huginn 3.5B와 같은 경계 단계가 큰 모델에서는 No-refill 모드가 더 효과적임을 확인하며, 모델 아키텍처(Boundary-stage cost)와 추론 시스템 간의 Co-design 중요성을 입증했습니다 [Figure 5, Figure 7].
4. Conclusion & Impact (결론 및 시사점)
본 논문은 Depth-adaptive Inference가 가능한 Looped LM을 효율적으로 서비스할 수 있는 최초의 시스템 솔루션을 제시했습니다. CDB를 통해 루프 모델의 연산 효율성을 극대화함으로써, 추후 고성능 언어 모델 설계 시 모델 구조와 추론 엔진을 통합적으로 고려해야 한다는 강력한 시사점을 제공합니다. 이러한 접근은 실시간 추론 서비스에서 컴퓨팅 자원 활용도를 크게 개선할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
- [논문리뷰] OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching
- [논문리뷰] LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay
- [논문리뷰] Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
- [논문리뷰] The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction
Review 의 다른글
- 이전글 [논문리뷰] CodeGraph: Open-Taxonomy Knowledge Graph for Source Code with Wikidata Grounding
- 현재글 : [논문리뷰] Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching
- 다음글 [논문리뷰] Disaggregated Quantization: Specializing LLM Prefill and Decode
댓글