본문으로 건너뛰기

[논문리뷰] SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops

링크: 논문 PDF로 바로 열기

메타데이터

저자: Ranran Haoran Zhang, Aysa Xuemo Fan, David Munhá Correia, Alex Cheema, Rui Zhang


1. Key Terms & Definitions (핵심 용어 및 정의)

  • Unified-Memory Desktops: CPU와 GPU가 물리적으로 LPDDR 메모리 풀을 공유하는 시스템(Apple Silicon, NVIDIA DGX Spark 등)을 의미하며, 고성능 HBM(High Bandwidth Memory) 기반의 데이터센터 가속기와 대조됨.
  • Serving Engine: 로컬 환경에서 LLM 추론을 수행하는 소프트웨어 스택으로, vllm-metal, llama.cpp, mlx_lm 등이 포함됨.
  • Fidelity: 모델이 생성한 출력물의 품질을 의미하며, 본 논문에서는 NVIDIA A100 기반의 vLLM 참조 모델 대비 정량적 평가 점수(F1 Score)로 정의됨.
  • Memory Discipline: 시스템의 가용 메모리 범위를 효율적으로 관리하여, 모델 추론뿐만 아니라 macOS 등 다른 애플리케이션의 동작을 방해하지 않는 제어 능력을 의미함.
  • Concurrency Scaling: 동시 요청(c)이 증가함에 따라 처리량(Throughput)이 선형적으로 향상되거나 일정 수준 이상을 유지하는지 평가하는 지표.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 통합 메모리 기반의 데스크탑 환경에서 LLM을 서빙할 때 단순히 속도(Speed)만 고려하는 기존 벤치마크의 한계점을 해결하고자 한다. 현재 많은 로컬 서빙 엔진들이 처리량 최적화에만 집중하여 메모리 가용성(Memory Headroom)과 출력 정확도(Fidelity)를 간과하고 있으며, 이는 실제 동시 요청 환경에서 시스템의 병목 현상이나 실패를 유발한다. 기존 연구들은 단일 요청 성능 위주로 다루어, 4~16개의 동시 요청이 발생하는 실무 에이전트 환경에서의 확장성을 충분히 대변하지 못한다 [Figure 1]. 따라서 본 연구는 이러한 환경에서의 성능, 메모리 효율, 정확도를 종합적으로 평가하는 새로운 벤치마크인 SiliconBench를 제안한다.

3. Method & Key Results (제안 방법론 및 핵심 결과)

저자들은 Apple Silicon 기반의 9개 서빙 엔진을 대상으로 Speed, Memory, Fidelity라는 세 가지 핵심 기준(Desiderata)을 통해 평가하는 SiliconBench 프레임워크를 제안한다. 9개 엔진에 대해 Qwen3-0.6B 모델을 공통 baseline으로 사용하여, 동시성 수준(c=1, 8, 16)에 따른 처리량, 지연 시간, 메모리 점유율을 정밀하게 분석하였다 [Figure 2]. 실험 결과, vllm-metal만이 동시성 1에서 16으로 증가할 때 처리량이 2배 이상 향상되는 유일한 스택이었으며, mlx_lm과 같은 일부 엔진은 동시성이 높아질 때 패딩으로 인한 메모리 낭비로 인해 오히려 성능 저하를 보였다. 특히 vllm-metal, llama.cpp, omlx 등 3개 스택만이 완성도(Completion), fidelity, 모델 지원 범위의 세 가지 평가 게이트를 통과하였다 [Figure 5]. 또한, multi-node 환경에서의 Tensor Parallelism(TP) 성능 비교 결과, Thunderbolt 기반 RDMA를 통한 TP 방식이 Pipeline Parallelism(PP) 방식보다 더 나은 확장성을 보여주었으며, 특정 상황에서는 단일 노드 대비 1.3배 이상의 성능 향상을 확인하였다 [Table 4].

4. Conclusion & Impact (결론 및 시사점)

본 논문은 LLM 로컬 서빙 성능이 단순히 처리량으로만 결정되지 않음을 입증하며, 메모리 관리와 출력 Fidelity를 포함한 종합적 평가의 중요성을 강조한다. SiliconBench는 다양한 소프트웨어 스택의 동시성 처리 한계를 명확히 규명하였으며, 개발자들이 더 안정적이고 효율적인 에이전트 서빙 환경을 구축할 수 있도록 가이드라인을 제공한다. 이 연구는 로컬 LLM 생태계가 실무 레벨의 안정성을 갖추도록 유도하며, 향후 더 높은 메모리 압박과 대규모 모델 서빙으로 나아가는 기술적 토대를 마련하였다는 점에서 의의가 크다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글