[vllm] vLLM DeepSeek V4 모델의 불필요한 메모리 할당 및 복사 최적화 분석vLLM DeepSeek V4 모델에서 MTP 미사용 시 불필요한 메모리 할당 및 복사를 제거하여 성능을 개선한 PR 분석#vLLM#DeepSeek V4#최적화#메모리 관리#성능 개선2026년 7월 30일댓글 수 로딩 중
[loki] Grafana Loki LogQL 최적화: `max_query_series` 한도 내에서 효율적인 시리즈 누적Loki LogQL 쿼리 엔진에서 `max_query_series` 한도를 효율적으로 적용하여 메모리 사용량을 최적화하는 방법.#Grafana Loki#LogQL#성능 최적화#Go#메모리 관리#Software Engineering2026년 7월 9일댓글 수 로딩 중
[vllm] vLLM, Diffusion-Gemma 샘플러 메모리 최적화: 요청 기반 타일링으로 OOM 문제 해결vLLM에서 Diffusion-Gemma 모델의 샘플링 과정 중 발생하는 메모리 OOM 문제를 요청 기반 타일링으로 해결한 PR을 분석합니다.#vLLM#Diffusion-Gemma#최적화#메모리 관리#LLM 추론2026년 7월 7일댓글 수 로딩 중
[sglang] Mamba GDN의 컨볼루션 캐시 최적화: 메모리 사용량 절반으로 줄이기Mamba 및 GDN 모델에서 컨볼루션 캐시 메모리 사용량을 절반으로 줄이는 최적화 기법을 소개합니다.#Mamba#GDN#최적화#메모리 관리#SGLang2026년 6월 18일댓글 수 로딩 중