[vllm] vLLM DeepSeek-OCR-2 모델의 TTFT 성능 최적화 분석DeepSeek-OCR-2의 CPU 병목인 4D 마스크 생성 로직을 텐서 연산 및 캐싱으로 최적화하여 TTFT를 1.8배 개선했습니다.#vLLM#DeepSeek-OCR-2#Performance#TTFT#PyTorch2026년 7월 26일댓글 수 로딩 중
[vllm] vLLM KV Offload 최적화: Tensor Parallelism 환경에서 MLA KV 캐시 복제본 제거하기vLLM에서 Tensor Parallelism 사용 시 MLA KV 캐시 복제본을 제거하여 CPU 메모리 및 D2H 트래픽을 최적화하는 방법을 분석합니다.#vLLM#KV Cache#Offloading#Tensor Parallelism#MLA#Optimization2026년 7월 26일댓글 수 로딩 중
[vllm] vLLM: PyNvVideoCodec 하드웨어 디코더 동시성 최적화로 비디오 처리량 94% 향상vLLM의 PyNvVideoCodec 디코더 동시성 설정 가능화로 비디오 처리량 최대 94% 개선.#vLLM#PyNvVideoCodec#GPU#Video Decoding#Optimization#Concurrency#Multimodal2026년 7월 25일댓글 수 로딩 중
[cpython] asyncio 프로토콜 데이터 처리 최적화: O(N^2)에서 O(N)으로asyncio 프로토콜의 데이터 처리 방식 개선으로 성능을 O(N^2)에서 O(N)으로 향상시켰습니다.#python#asyncio#performance#optimization#cpython2026년 7월 25일댓글 수 로딩 중
[sglang] SGLang NGRAM 성능 최적화: 호스트 기반 트리 링크 유도로 GPU 병목 제거하기NGRAM 추론 시 발생하는 불필요한 GPU-CPU 동기화(readback)를 제거하여 처리량을 8.3% 향상시킨 최적화 사례를 분석합니다.#SGLang#LLM#Speculative Decoding#Performance Optimization#CUDA2026년 7월 25일댓글 수 로딩 중
[sglang] SGLang의 Marlin MoE 커널 최적화: JIT 컴파일 시간 특화와 점유율 기반 스케줄링Marlin MoE 커널의 분기 제거 및 점유율 최적화를 통해 Kimi-K2.7 모델의 Prefill 성능을 약 4% 향상시킨 사례 분석#SGLang#CUDA#Marlin#MoE#Performance2026년 7월 25일댓글 수 로딩 중
[vllm] vLLM, 캐싱 비활성화 시 불필요한 LRU 해시 분할 제거로 디코드 처리량 3.5% 향상vLLM에서 캐싱 비활성화 시 불필요한 LRU 해시 분할 로직을 제거하여 디코드 처리량을 개선한 PR 분석.#vLLM#성능 최적화#LLM#GPU 캐싱#LRU2026년 7월 25일댓글 수 로딩 중
[triton] Triton Blackwell 커널의 MXFP8 활성화 스케일 최적화: Zero Padding 전략Blackwell 아키텍처에서 MXFP8 활성화 스케일 저장 시 발생하는 성능 저하를 Producer 측의 Zero Padding으로 해결한 사례 분석.#Triton#Blackwell#MXFP8#KernelOptimization#GPU2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP8 양자화 AllReduce를 통한 통신 대역폭 최적화FP8 양자화를 통해 AllReduce 통신량을 절반으로 줄여 대규모 모델 학습의 NVLink 병목을 해결합니다.#FlashInfer#AllReduce#FP8#Quantization#NVLink#Triton2026년 7월 24일댓글 수 로딩 중
[vllm] vLLM, Blackwell 아키텍처를 위한 디코드 성능 최적화: GLM-5.2 및 DeepSeek-V3.2 지원 강화vLLM이 Blackwell GPU에서 GLM-5.2 및 DeepSeek-V3.2 모델의 디코드 성능을 대폭 향상시키는 최적화를 소개합니다.#vLLM#Blackwell#GLM-5.2#DeepSeek-V3.2#성능 최적화#GPU 컴퓨팅#LLM2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Blackwell (SM120+)에서 NVFP4 QMoE를 위한 네이티브 FP4xFP4 Prefill 최적화ONNX Runtime이 Blackwell GPU에서 NVFP4 QMoE의 FP4xFP4 prefill 경로를 최적화하고, SM120 빌드 오류를 해결한 PR 분석.#ONNXRuntime#CUDA#FP4#Quantization#Blackwell#SM120#CUTLASS#Optimization#MoE2026년 7월 24일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] CPU GQA 성능의 한계를 넘다: FP16 입력과 양자화된 KV 캐시 최적화 분석FP16 활성화 함수와 INT8/INT4 KV 캐시를 결합하여 CPU 추론 성능을 극대화한 ONNX Runtime의 최신 GQA 최적화 기법을 살펴봅니다.#ONNX Runtime#LLM Optimization#CPU Inference#SIMD#C++2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer SM103 FP4 GEMM 최적화: Store256 및 Fused Epilogue 도입SM103 아키텍처에서 256-bit 정렬 스토어와 Fused F32x2 연산을 통해 FP4 GEMM 성능을 최대 16% 향상시킨 기술적 분석.#FlashInfer#CUDA#GEMM#SM103#Optimization#CUTLASS2026년 7월 23일댓글 수 로딩 중
[sglang] SGLang Mamba 캐시의 상태 손상 및 슬롯 누수 버그 수정SGLang Mamba 캐시에서 발생하던 요청 상태 손상 및 슬롯 누수 버그를 수정하여 안정성을 높였습니다.#SGLang#Mamba#Cache#Bug Fix#Optimization#LLM2026년 7월 23일댓글 수 로딩 중
[vllm] vLLM Inkling 모델: 인플레이스 연산으로 GPU 메모리 최적화 및 OOM 방지vLLM Inkling 모델에서 불필요한 임시 텐서 할당을 제거하여 GPU 메모리 사용량을 최적화하고 OOM을 방지하는 기술적 개선.#vLLM#PyTorch#GPU Optimization#Memory Management#Inkling Model#OOM Prevention#In-place Operations2026년 7월 23일댓글 수 로딩 중
[vllm] vLLM의 KV 캐시 로드 경로 최적화: NumPy를 활용한 VectorizationvLLM의 KV 캐시 로드 경로에서 발생하는 병목 현상을 NumPy를 이용해 개선한 PR 분석#vLLM#성능 최적화#KV 캐시#Vectorization#NumPy#Python2026년 7월 23일댓글 수 로딩 중
[llm-compressor] vLLM LLM-Compressor: CUDA OOM 문제 해결을 위한 메모리 핀닝 최적화CUDA OOM을 유발하던 무분별한 메모리 핀닝을 지연 핀닝 방식으로 변경하여 대규모 모델의 AWQ 최적화 안정성을 확보했습니다.#vLLM#LLM-Compressor#CUDA#Memory Management#AWQ#Optimization2026년 7월 23일댓글 수 로딩 중
[ray] Ray Serve LLM 인그레스 최적화: 로컬 라우팅을 통한 병목 현상 제거단일 글로벌 라우터의 병목을 해결하기 위해 HAProxy와 동일 노드에 위치한 라우터로 요청을 분산하고 가용성을 높이는 아키텍처 개선 사항을 분석합니다.#Ray#Ray Serve#LLM#HAProxy#Optimization#Distributed Systems2026년 7월 22일댓글 수 로딩 중
[hermes-agent] SQLite FTS5 최적화: CJK Bigram 인덱싱으로 검색 성능 개선하기SQLite FTS5의 CJK 언어 검색 한계를 극복하기 위해 커스텀 토크나이저를 도입하여 검색 속도를 획기적으로 개선했습니다.#SQLite#FTS5#Performance#CJK#Database2026년 7월 22일댓글 수 로딩 중
[flashinfer] FlashInfer MoE All-to-All 최적화: TRT-LLM의 성능 비결을 파헤치다FlashInfer의 MoE All-to-All 통신 최적화 PR을 통해 TRT-LLM의 성능 개선 기법을 분석합니다.#FlashInfer#MoE#All-to-All#CUDA#GPU Optimization#TensorRT-LLM#FP8#PDL2026년 7월 22일댓글 수 로딩 중