[sglang] SGLang LTX-2 모델을 위한 Breakable CUDA Graph 최적화 분석LTX-2 모델의 Breakable CUDA Graph 지원을 통해 H200 환경에서 추론 속도를 1.56배 향상시킨 최적화 기법을 분석합니다.#SGLang#CUDA Graph#LTX-2#Performance Optimization#LLM Serving2026년 8월 7일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: 과도한 Prefill CUDA Graph Padding 방지로 TTFT 개선SGLang이 과도한 Prefill CUDA Graph Padding을 방지하여 불필요한 연산을 줄이고 TTFT를 크게 개선한 최적화 과정을 분석합니다.#SGLang#CUDA Graph#LLM Serving#Performance Optimization#Prefill#TTFT#Python#Deep Learning2026년 7월 18일댓글 수 로딩 중
[논문리뷰] GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving본 논문은 전역적으로 분산된 LLM 추론 환경에서 네트워크 지연, KV-cache 로컬리티, 서버 부하를 동시에 고려하는 최적의 로드 밸런싱 정책 부재 문제를 해결합니다.#Review#LLM Serving#Cross-Region#Load Balancing#KV-Cache#Online Tuning#Network Latency#Evolutionary Strategy2026년 7월 6일댓글 수 로딩 중
[논문리뷰] Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving본 논문은 프로덕션 환경에서 LLM 배포 시 발생하는 정확도와 비용(Latency) 간의 트레이드오프 문제를 해결하기 위한 Cascaded Framework를 제안합니다.#Review#LLM Serving#Model Routing#Cost-Aware Inference#Quality Estimation#Cascaded Framework#Pareto Analysis#TPOT2026년 6월 28일댓글 수 로딩 중
[논문리뷰] The Price of Anarchy in Disaggregated Inference본 연구는 Disaggregated Inference 시스템이 다수의 독립적인 에이전트(요청, 연산 풀, 캐시 블록)가 자원을 놓고 경쟁하는 복잡한 멀티 에이전트 시스템이라는 점에 주목한다.#Review#Disaggregated Inference#Price of Anarchy#LLM Serving#Game Theory#Resource Allocation#KV Cache2026년 6월 16일댓글 수 로딩 중
[논문리뷰] Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving본 논문은 Multi-turn LLM serving 시 발생하는 선형적인 KV Cache 증가 문제를 해결하기 위해 도입된 Non-uniform KV Cache Compression이, 기존의 시스템 소프트웨어 스택과 충돌하여 발생하는 심각한 효율성 저하 문제를 지적합니다.#Review#LLM Serving#KV Cache Compression#Non-uniform Compression#PagedAttention#Deterministic Scheduling#AOT Load Balancing2026년 6월 15일댓글 수 로딩 중
[vllm] [vLLM] MiniMax-M2 MoE Gate 최적화: Fused FP32 Kernel로 서빙 성능 32% 향상시키기vLLM에서 MiniMax-M2 모델의 MoE Gate 연산을 Fused Kernel로 최적화하여 저지연 환경의 성능을 대폭 개선한 사례를 분석합니다.#vLLM#CUDA#MoE#Optimization#MiniMax-M2#LLM Serving2026년 5월 30일댓글 수 로딩 중
[논문리뷰] KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving본 논문은 Disaggregated LLM Serving 환경에서 KV cache 통신이 전체 end-to-end 지연시간의 최대 60%를 차지하는 주요 병목 현상을 해결하고자 한다 .#Review#LLM Serving#KV Cache Compression#Disaggregated Inference#Bayesian Optimization#Service-Aware Control2026년 5월 21일댓글 수 로딩 중
[SGLang] FastAPI 기반 HTTP 서버: 비동기 추론 서빙의 진입점SGLang의 FastAPI 기반 HTTP 서버 구현을 분석한다. 라우트 등록, 미들웨어 구성, OpenAI 호환 핸들러 초기화, 비동기 요청 처리 흐름을 코드와 함께 살펴본다.#sglang#HTTP Server#FastAPI#LLM Serving2026년 4월 9일댓글 수 로딩 중
[Ray Serve] SGLang 서버의 순차 배치 처리를 동시 실행으로 전환completions 엔드포인트에서 여러 프롬프트를 for 루프로 순차 처리하던 로직을 SGLang의 네이티브 배치 호출로 변경하여 동시 처리 성능을 개선한 수정.#Ray#Python#Performance#SGLang#LLM Serving2026년 3월 24일댓글 수 로딩 중
[논문리뷰] FlowPrefill: Decoupling Preemption from Prefill Scheduling Granularity to Mitigate Head-of-Line Blocking in LLM Serving본 논문은 LLM 서빙 시스템에서 컴퓨팅 집약적인 프리필(prefill) 단계 중 발생하는 헤드-오브-라인(Head-of-Line, HoL) 블로킹 문제 를 해결하고자 합니다.#Review#LLM Serving#Head-of-Line Blocking#Preemption#Prefill Scheduling#Time-to-First-Token (TTFT)#SLO-aware Scheduling#Operator-Level Preemption#Event-Driven Scheduling2026년 2월 24일댓글 수 로딩 중