[vllm] vLLM DeepSeek-V4 성능 최적화: Eager Break 시 Workspace 재사용 개선vLLM DeepSeek-V4 모델에서 Eager Break 시 Workspace 재사용을 최적화하여 TTFT를 3.9% 개선한 PR 분석#vLLM#DeepSeek-V4#성능 최적화#Eager Break#Workspace Reuse#CUDA Kernel2026년 7월 31일댓글 수 로딩 중
[SGLang] sgl-kernel: 커스텀 C++/CUDA 커널 라이브러리SGLang의 sgl-kernel 라이브러리를 분석한다. 커스텀 C++/CUDA 커널의 구조, AllReduce/Attention/Quantization/Sampling 등 주요 커널 카테고리를 코드와 함께 살펴본다.#sglang#sgl-kernel#CUDA Kernel#C++ Extension2026년 4월 14일댓글 수 로딩 중