[vllm] vLLM DeepSeek-V4 성능 최적화: 불필요한 torch.full 커널 제거로 1.88배 속도 향상DeepSeek-V4의 combine_topk_swa_indices 연산에서 out 텐서를 재사용하여 불필요한 메모리 할당 및 커널 호출을 제거하고 성능을 1.88배 개선했습니다.#vLLM#DeepSeek-V4#CUDA#Performance#Optimization2026년 7월 30일댓글 수 로딩 중
[vllm] vLLM DeepSeek V4 모델의 불필요한 메모리 할당 및 복사 최적화 분석vLLM DeepSeek V4 모델에서 MTP 미사용 시 불필요한 메모리 할당 및 복사를 제거하여 성능을 개선한 PR 분석#vLLM#DeepSeek V4#최적화#메모리 관리#성능 개선2026년 7월 30일댓글 수 로딩 중
[vllm] vLLM 컴파일 최적화: Transformers 모델을 위한 FusedAddRMSNorm 도입Transformers 모델의 잔차 연결과 RMSNorm을 융합하여 메모리 접근을 줄이고 추론 성능을 최대 18% 향상시키는 최적화 기법을 소개합니다.#vLLM#LLM#Compiler#Optimization#PyTorch#Transformers2026년 7월 30일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 모델의 성능을 극적으로 향상시키는 융합 커널과 최적화된 스케줄러 도입FlashInfer가 MoE 모델의 FC1 연산을 융합 커널로 최적화하고, 워프 협력 스케줄러를 도입하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#FP8#MXFP8#CUDA2026년 7월 29일댓글 수 로딩 중
[transformers] Hugging Face Transformers: NoRepeatNGramLogitsProcessor 벡터화 및 성능 최적화NoRepeatNGramLogitsProcessor의 파이썬 루프와 호스트 동기화를 제거하고 텐서 연산으로 벡터화하여 성능을 대폭 개선했습니다.#HuggingFace#Transformers#Optimization#PyTorch#Performance2026년 7월 29일댓글 수 로딩 중
[vllm] [vLLM 분석] Speculative Decoding 성능 최적화: DSpark Markov Head 복제 전략TP 환경에서 작은 레이어의 샤딩으로 인한 통신 오버헤드를 제거하여 추론 속도를 최대 3.8% 향상시킨 기법을 살펴봅니다.#vLLM#Speculative Decoding#Tensor Parallelism#Performance Optimization#Deep Learning2026년 7월 29일댓글 수 로딩 중
[triton] Triton JIT의 메모리 누수 방지: Reference Cycle 제거를 통한 성능 최적화Triton의 compute_cache_key 함수 내 재귀적 클로저를 전역 함수로 리팩토링하여 메모리 참조 사이클을 제거한 사례를 분석합니다.#Triton#Python#MemoryManagement#Optimization#JIT2026년 7월 29일댓글 수 로딩 중
[hermes-agent] SQLite WAL 모드를 활용한 Read-Path 최적화: Lock Contention 해결하기SQLite WAL 모드에서 스레드별 읽기 전용 커넥션을 도입하여 쓰기 작업과 읽기 작업 간의 Lock 경합을 제거했습니다.#SQLite#Performance#Concurrency#Python#Database2026년 7월 28일댓글 수 로딩 중
[hermes-agent] SQL GROUP BY를 활용한 세션 통계 쿼리 최적화: 575ms에서 1ms 미만으로불필요한 데이터 로딩을 제거하고 SQL 집계 함수를 사용하여 대규모 데이터베이스의 API 응답 속도를 500배 이상 개선한 사례를 분석합니다.#SQL#Performance#Optimization#Python#Database2026년 7월 28일댓글 수 로딩 중
[hermes-agent] NousResearch Hermes Agent 성능 최적화: Prompt 캐싱, Reasoning Timeout, Lazy Compressor 초기화Hermes Agent의 핵심 성능 병목 지점을 개선하여 응답 속도를 획기적으로 향상시킨 코드 변경 분석.#Python#Performance Optimization#AI Agent#Hermes#NousResearch2026년 7월 28일댓글 수 로딩 중
[hermes-agent] [기술 분석] LLM 에이전트의 성능 병목 해결: 비동기 토큰 카운팅과 쓰기 병합(Coalescing) 기법DB 쓰기 지연으로 인한 에이전트 루프 정체를 백그라운드 스레드와 델타 병합 기법으로 해결하여 p50 지연시간을 0.54ms에서 0.0005ms로 단축한 사례를 분석합니다.#Python#Performance#SQLite#Concurrency#LLM-Agent2026년 7월 28일댓글 수 로딩 중
[flashinfer] FlashInfer의 Mixture-of-Experts(MoE) 라우팅 성능 최적화 분석고성능 MoE 워크로드를 위한 TopK 라우팅 최적화: 레지스터 압력 감소 및 병렬화 전략#FlashInfer#CUDA#MoE#Performance#GPU2026년 7월 28일댓글 수 로딩 중
[vllm] [vLLM] Hopper와 Blackwell을 위한 Router GEMM 최적화: DeepSeek-V4와 GLM5.2 성능 극대화하기vLLM에서 MoE 모델의 병목인 Router GEMM을 GPU 아키텍처별로 정밀 튜닝하여 최대 5.8%의 성능 향상을 이끌어낸 과정을 살펴봅니다.#vLLM#CUDA#MoE#DeepSeek-V4#Performance-Tuning#Hopper#Blackwell2026년 7월 27일댓글 수 로딩 중
[vllm] vLLM Triton 커널 최적화: tl.constexpr 제거를 통한 JIT 컴파일 오버헤드 해결Triton 커널의 불필요한 constexpr 인자를 런타임 인자로 변경하여 JIT 컴파일 병목을 제거하고 TTFT를 대폭 개선했습니다.#vLLM#Triton#LLM#Optimization#Performance2026년 7월 27일댓글 수 로딩 중
[sglang] SGLang, EmbeddingGemma 사전 추론 성능 최적화: CUDA 그래프와 배치 처리의 힘SGLang이 EmbeddingGemma의 사전 추론 성능을 CUDA 그래프와 배치 처리를 통해 획기적으로 개선한 방법을 분석합니다.#SGLang#EmbeddingGemma#성능 최적화#CUDA Graph#Batching#LLM 서빙2026년 7월 27일댓글 수 로딩 중
[vllm] vLLM MRV2 샘플러: 불필요한 FP32 Logits Materialization 건너뛰기 최적화vLLM MRV2 샘플러에서 불필요한 FP32 logits 변환을 건너뛰어 성능을 최적화합니다.#vLLM#성능 최적화#LLM 추론#GPU#PyTorch2026년 7월 27일댓글 수 로딩 중
[sglang] SGLang: HPC-Ops 백엔드에서 BF16 디코딩을 위한 동적 스케줄링 도입HPC-Ops의 동적 스케줄링을 BF16으로 확장하여 불균일한 KV 길이 환경에서 디코딩 성능을 최대 4.3% 향상시켰습니다.#SGLang#LLM#HPC-Ops#Optimization#CUDA2026년 7월 27일댓글 수 로딩 중
[sglang] [DeepSeek-V4 최적화] SM120(Blackwell)에서 Fused MHC 커널 활성화로 성능 8.9% 향상시키기SM120 아키텍처에서 잘못된 플래그 게이팅을 수정하여 DeepSeek-V4의 Fused MHC 커널을 활성화하고 디코드 성능을 대폭 개선했습니다.#DeepSeek-V4#SM120#Blackwell#Kernel Fusion#SGLang#Performance2026년 7월 26일댓글 수 로딩 중
[ultralytics] Ultralytics FLOPs 프로파일링 최적화: deepcopy 제거를 통한 성능 향상모델 복사본 생성 없이 직접 프로파일링하여 FLOPs 계산 속도를 2.5배 향상시킨 최적화 사례를 소개합니다.#PyTorch#Performance#Optimization#Ultralytics#FLOPs2026년 7월 26일댓글 수 로딩 중
[vllm] vLLM 멀티모달 처리 성능 개선: MM 전처리를 위한 별도 Executor 도입vLLM에서 멀티모달 요청 처리 시 토크나이저와 MM 전처리 간의 경합을 제거하여 성능을 향상시킵니다.#vLLM#성능 최적화#멀티모달#병렬 처리#Executor2026년 7월 26일댓글 수 로딩 중