[sglang] HiCache 최적화: TMA를 활용한 Host-Device KV 캐시 전송 성능 2배 향상TMA(Tensor Memory Accelerator)를 도입하여 Host-Device 간 KV 캐시 전송 대역폭을 2배 개선하고 링크 효율을 극대화한 기술 분석.#SGLang#CUDA#TMA#Hicache#Optimization2026년 9월 21일댓글 수 로딩 중