[sglang] SGLang: Wan VAE의 RMSNorm 및 SiLU 연산 융합을 통한 추론 가속Wan VAE의 RMSNorm과 SiLU 연산을 Triton 커널로 융합하여 DecodingStage 성능을 최대 11.5% 개선했습니다.#SGLang#Triton#Optimization#Diffusion#VAE2026년 8월 5일댓글 수 로딩 중
[triton] Triton AMD GPU 최적화: Warp-based Split-K 도입을 통한 MQA 성능 향상AMD gfx1250 아키텍처에서 MQA 디코딩 성능을 극대화하기 위해 기존 CTA-based Split-K를 Warp-based로 최적화한 사례 분석.#Triton#AMD#GPU#Optimization#MQA#HPC2026년 8월 5일댓글 수 로딩 중
[flashinfer] Blackwell NVFP4 양자화 최적화: TMA OOB Zero-fill을 이용한 메모리 복사 오버헤드 제거TMA의 하드웨어 기능을 활용해 비정렬 데이터의 패딩 복사 오버헤드를 제거하고 성능을 72% 개선한 FlashInfer의 최적화 사례를 분석합니다.#FlashInfer#NVIDIA Blackwell#NVFP4#TMA#CUDA#Performance Optimization2026년 8월 4일댓글 수 로딩 중
[sglang] Diffusion DiT 모델의 FFN 성능 최적화: cublasLt GELU Epilogue 융합Diffusion DiT 모델의 FFN 연산에서 GEMM과 GELU를 융합하여 커널 호출 오버헤드를 줄이고 HBM 접근을 최적화했습니다.#Diffusion#CUDA#Optimization#SGLang#Performance2026년 8월 4일댓글 수 로딩 중
[triton] Triton FPSAN의 MMA 에뮬레이션 오버헤드 최적화 분석Triton FPSAN에서 불필요한 스크래치 메모리 복사를 제거하여 컴파일 및 런타임 성능을 15-25% 향상시킨 사례를 분석합니다.#Triton#Compiler#Optimization#GPU#FPSAN2026년 8월 4일댓글 수 로딩 중
[hermes-agent] Python 백엔드 콜드 스타트 성능 개선: 14초 GIL 스톨 해결하기Windows 환경에서 발생하는 14초 규모의 GIL 스톨을 모듈 사전 로딩과 비동기 처리를 통해 해결한 최적화 사례입니다.#Python#Performance#AsyncIO#GIL#Optimization2026년 8월 3일댓글 수 로딩 중
[flashinfer] FlashInfer: B200용 최적화된 Recurrent KDA Prefill 백엔드 도입NVIDIA B200(SM100a) 아키텍처를 위한 고성능 Recurrent KDA Prefill 백엔드 추가 및 성능 최적화 분석#FlashInfer#B200#CUDA#KDA#Performance2026년 8월 3일댓글 수 로딩 중
[onnxruntime] [CUDA] QMoE MXFP4/NVFP4 가중치 역양자화 성능 최적화: Coalesced Memory Access의 힘ONNX Runtime의 QMoE 가중치 역양자화 커널을 Coalesced Memory Access 패턴으로 최적화하여 MoE 모델의 추론 속도를 대폭 향상시킨 PR 분석.#CUDA#ONNXRuntime#MoE#Optimization#GPU#DeepLearning#FP4#Dequantization#MemoryAccess2026년 8월 3일댓글 수 로딩 중
[sglang] AMD MI350x에서 Qwen3.5의 Long-Context Prefill 성능을 극대화하는 FP8 FMHA 최적화 분석Qwen3.5 모델의 긴 컨텍스트 Prefill 성능을 위한 AMD MI350x 전용 FP8 FMHA 커널 통합 분석.#SGLang#AMD#ROCm#MI350x#Qwen3.5#FMHA#FP8#성능 최적화#Prefill2026년 8월 3일댓글 수 로딩 중
[sglang] SGLang의 Session-Aware Unified Radix Cache를 통한 추론 성능 최적화멀티턴 에이전트 워크로드에서 세션 기반 KV 캐시 보호를 통해 재계산을 줄이고 처리량을 극대화하는 최적화 기법을 소개합니다.#SGLang#LLM#KV Cache#Radix Cache#Performance Optimization2026년 8월 2일댓글 수 로딩 중
[sglang] sglang, MoE 모델 로딩 속도 5.6배 향상: mmap 뷰 최적화 분석sglang에서 MoE 모델 로딩 시 발생하는 병목 현상을 해결하여 로딩 속도를 획기적으로 개선한 PR을 분석합니다.#sglang#MoE#최적화#성능 개선#모델 로딩#AMD GPU2026년 8월 2일댓글 수 로딩 중
[sglang] SGLang, KV VMM 할당자 스텁 최적화를 통한 시작 시간 및 라이브러리 크기 대폭 개선SGLang의 KV VMM 할당자 스텁 빌드 시 불필요한 PyTorch 헤더 포함을 제거하여 시작 시간과 라이브러리 크기를 획기적으로 줄였습니다.#SGLang#최적화#성능#PyTorch#C++#빌드 시스템2026년 8월 1일댓글 수 로딩 중
[sglang] MiniMax-M3 모델을 위한 FP8 Attention GEMM 최적화 및 성능 개선MiniMax-M3 모델의 FP8 Attention GEMM을 SM100 아키텍처에서 최적화하여 프리필 성능을 최대 66% 향상시켰습니다.#SGLang#FP8#Attention#CUDA#Optimization2026년 8월 1일댓글 수 로딩 중
[sglang] DeepSeek-V4 Flash 공식 모델 최적화: H200 및 B200을 위한 SGLang 서빙 전략SGLang v0.5.16에서 DeepSeek-V4 Flash 공식 모델의 H200/B200 최적화 설정과 검증된 벤치마크 결과를 분석합니다.#SGLang#DeepSeek-V4#H200#B200#LLM-Serving#Optimization2026년 8월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[sglang] SGLang Diffusion: 2-rank Ulysses를 위한 CUDA-IPC 기반 Zero-Staging All-to-All 최적화2-rank Ulysses 환경에서 NCCL 대신 CUDA-IPC를 사용하여 데이터 복사 오버헤드를 제거하고 전체 성능을 약 10% 향상시킨 최적화 사례.#SGLang#CUDA#NCCL#Ulysses#Performance2026년 7월 31일댓글 수 로딩 중
[flashinfer] FlashInfer FP8 Causal Attention 최적화: O(1) 디코딩과 글로벌 스케줄링의 힘FlashInfer의 FP8 FMHA v2 커널에서 배치 크기가 클 때 발생하는 병목을 O(1) 디코딩과 글로벌 큐 타일 재배치로 해결하여 최대 5.6x 성능 향상을 달성했습니다.#CUDA#LLM#FlashInfer#Performance#Optimization#FP82026년 7월 31일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU EP: 디바이스 없는 오프라인 컴파일 지원WebGPU EP에서 하드웨어 없이 모델을 최적화하고 직렬화할 수 있는 'Compile-only' 세션 모드를 구현하여 보안 및 샌드박스 환경을 지원합니다.#ONNXRuntime#WebGPU#Optimization#Compiler#Security2026년 7월 31일댓글 수 로딩 중
[vllm] vLLM DeepSeek-V4 성능 최적화: Eager Break 시 Workspace 재사용 개선vLLM DeepSeek-V4 모델에서 Eager Break 시 Workspace 재사용을 최적화하여 TTFT를 3.9% 개선한 PR 분석#vLLM#DeepSeek-V4#성능 최적화#Eager Break#Workspace Reuse#CUDA Kernel2026년 7월 31일댓글 수 로딩 중
[sglang] [성능 최적화] 불필요한 Tree Mask Fill 제거를 통한 Speculative Decoding 가속화SGLang의 Speculative Decoding 과정에서 매 단계 발생하는 대규모 메모리 초기화(memset) 오버헤드를 제거하여 추론 속도를 개선한 PR을 분석합니다.#SGLang#Speculative Decoding#Performance Optimization#PyTorch#LLM Inference2026년 7월 30일댓글 수 로딩 중