[sglang] Apple Silicon LLM 성능 향상: 슬라이딩 윈도우 KV 캐싱 및 인-그래프 샘플링 도입Apple Silicon 환경에서 LLM의 메모리 사용량과 추론 속도를 개선하는 두 가지 주요 최적화 기법을 소개합니다.#MLX#Apple Silicon#LLM#최적화#성능#KV 캐싱#샘플링2026년 8월 10일댓글 수 로딩 중
[sglang] SGLang HiCache: Mamba 브랜칭을 위한 증분 백업 최적화Unified Radix Cache에서 Mamba 상태의 증분 백업을 지원하여 중복 데이터 복사 없이 효율적인 캐시 관리를 구현했습니다.#SGLang#LLM#Caching#Mamba#Performance2026년 8월 10일댓글 수 로딩 중
[cpython] contextlib.contextmanager 최적화: next() 대신 for 루프 사용contextlib.contextmanager에서 next() 호출을 for 루프로 변경하여 성능을 개선한 PR 분석#python#optimization#contextlib#performance2026년 8월 10일댓글 수 로딩 중
[hermes-agent] Hermes Agent: 10배 빠른 프로젝트 그룹화 최적화 분석불필요한 git subprocess 호출을 제거하고 캐싱 전략을 개선하여 프로젝트 트리 빌드 속도를 3.3초에서 0.3초로 단단히 개선한 사례입니다.#Python#Performance#Git#Optimization#Software Engineering2026년 8월 9일댓글 수 로딩 중
[sglang] SGLang, Sol-Attn 도입으로 비디오 생성 속도 1.23배 향상SGLang에 Sol-Attn 희소 어텐션 백엔드를 도입하여 비디오 생성 속도를 크게 향상시킨 기술 블로그 글입니다.#SGLang#AI#비디오 생성#최적화#Sol-Attn#희소 어텐션2026년 8월 9일댓글 수 로딩 중
[ultralytics] RT-DETR FLOPs 프로파일링 성능 최적화 및 안정화RT-DETR 모델의 FLOPs 계산 시 발생하는 비효율적인 stride-based proxy 방식을 개선하여 프로파일링 속도를 최대 5배 이상 향상시켰습니다.#RT-DETR#FLOPs#Performance Optimization#Deep Learning#THOP2026년 8월 9일댓글 수 로딩 중
[sglang] [Kimi K3] CPU 전송 이미지의 지연 전처리(Deferred Preprocessing)를 통한 VLM 성능 최적화Kimi-K3 모델에서 이미지 전처리를 실제 연산을 수행하는 GPU(Vision Owner)로 미루어 데이터 전송 오버헤드를 줄이고 TTFT를 최대 78% 개선한 사례를 분석합니다.#VLM#Optimization#SGLang#Kimi-K3#Distributed-Computing2026년 8월 9일댓글 수 로딩 중
[ollama] Ollama, DFlash를 통한 추론 속도 향상: 블록 단위 추론의 힘Ollama가 DFlash를 도입하여 모델 추론 시 블록 단위 토큰 생성을 통해 속도를 크게 개선했습니다.#Ollama#MLX#추론 최적화#DFlash#LLM2026년 8월 8일댓글 수 로딩 중
[sglang] SGLang 캐시 시뮬레이터의 병목 해결: 직렬 전송에서 동시성 전송으로의 최적화SGLang의 캐시 시뮬레이터 ingest tee를 직렬 방식에서 동시성(fan-out) 방식으로 개선하여 처리량 병목을 해결했습니다.#SGLang#Rust#Tokio#Performance#Concurrency2026년 8월 8일댓글 수 로딩 중
[vllm] [vLLM] CPU MoE 성능을 극대화하는 전략: 고정 임계값을 넘어선 동적 GEMM 디스패치 최적화vLLM의 CPU FP8/MXFP4 MoE 커널에서 전역 평균 기반의 GEMM 선택 로직을 제거하고, 개별 전문가 블록 단위로 BRGEMM을 동적 선택하여 최대 1.59배의 성능 향상을 달성했습니다.#vLLM#CPU Optimization#MoE#FP8#BRGEMM#Deep Learning2026년 8월 8일댓글 수 로딩 중
[cpython] CPython 최적화: functools.reduce 대신 Union 직접 사용하기typing.Union 재구성 시 functools.reduce를 제거하여 성능을 최대 35배 개선했습니다.#CPython#Python#Performance#Optimization#typing2026년 8월 7일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell GPU를 위한 Gated MoE 커널 최적화로 성능 대폭 향상Blackwell GPU의 Gated Mixture-of-Experts(MoE) 연산 성능을 극대화하는 최적화 기법을 분석합니다.#FlashInfer#MoE#GPU 최적화#Blackwell#NVFP42026년 8월 7일댓글 수 로딩 중
[sglang] [SGLang] Diffusion 모델의 TP/FSDP 체크포인트 로딩 속도를 20% 이상 개선하는 방법모든 랭크가 전체 체크포인트를 읽던 비효율을 해결하고, 필요한 슬라이스만 선택적으로 로드하여 I/O 부하를 절반으로 줄였습니다.#SGLang#PyTorch#Distributed-Training#Checkpoint-Loading#Performance-Optimization2026년 8월 7일댓글 수 로딩 중
[sglang] SGLang LTX-2 모델을 위한 Breakable CUDA Graph 최적화 분석LTX-2 모델의 Breakable CUDA Graph 지원을 통해 H200 환경에서 추론 속도를 1.56배 향상시킨 최적화 기법을 분석합니다.#SGLang#CUDA Graph#LTX-2#Performance Optimization#LLM Serving2026년 8월 7일댓글 수 로딩 중
[sglang] [Diffusion] Qwen 모델의 Varlen Mask 메타데이터 호스트 측 빌드 최적화Qwen Diffusion 모델에서 GPU 동기화를 유발하던 Varlen Mask 메타데이터 생성을 호스트 측으로 옮겨 성능을 개선합니다.#SGLang#Diffusion#Performance Optimization#PyTorch#Varlen Attention#Qwen2026년 8월 7일댓글 수 로딩 중
[sglang] FLUX.2 모델의 추론 속도 향상: Residual-Gate 커널 최적화FLUX.2 모델의 residual-gate 연산을 전용 CUDA 커널로 통합하여 추론 속도를 약 1.2% 개선했습니다.#SGLang#FLUX.2#CUDA#Optimization#Diffusion2026년 8월 6일댓글 수 로딩 중
[sglang] ERNIE-Image 모델의 성능 향상: 비트-정확성(Bit-Exact)을 유지한 RMSNorm+Scale/Shift 융합 커널 도입ERNIE-Image 모델에서 RMSNorm과 Scale/Shift 연산을 융합하여 성능을 개선하고, 비트-정확성을 완벽하게 보장하는 Triton 커널을 소개합니다.#Triton#ERNIE-Image#성능 최적화#딥러닝#LLM2026년 8월 6일댓글 수 로딩 중
[onnxruntime] [CUDA] NVFP4 QMoE GEMV 최적화: ALU 바운드 커널의 한계를 넘어서는 방법NVFP4 양자화 디코딩 속도를 30% 이상 개선하고, MTP 검증 성능을 20배 이상 끌어올린 ONNX Runtime의 최적화 기법을 분석합니다.#CUDA#ONNXRuntime#LLM#Optimization#NVFP4#MoE2026년 8월 6일댓글 수 로딩 중
[flashinfer] [FlashInfer] Kimi K3 모델을 위한 초고속 Fused KDA Decode 커널 분석 (SM100 최적화)FlashInfer가 Kimi K3의 핵심 연산들을 하나의 SM100 전용 커널로 통합하여 vLLM 대비 1.13배의 성능 향상을 달성했습니다.#CUDA#FlashInfer#LLM#Optimization#SM100#CuTe2026년 8월 5일댓글 수 로딩 중
[flashinfer] FlashInfer의 Blackwell 아키텍처 최적화: CAKE 기반 TinyGEMM2 커널 도입Blackwell(SM100/103) 아키텍처를 위한 고성능 TinyGEMM2 커널을 도입하여 추론 성능을 최대 1.79배 향상시켰습니다.#FlashInfer#CUDA#Blackwell#GEMM#PerformanceOptimization2026년 8월 5일댓글 수 로딩 중