[sglang] SGLang: LongCat-Image DiT의 FFN 연산 최적화 - Tanh-GELU 퓨전 적용LongCat-Image 모델의 FFN up-projection과 Tanh-GELU를 커널 퓨전하여 추론 성능을 1.5% 개선했습니다.#SGLang#DeepLearning#Optimization#KernelFusion#CUDA2026년 8월 26일댓글 수 로딩 중
[vllm] vLLM, Pixtral 모델의 멀티모달 인코더 어텐션 최적화: Packed Sequence Metadata 도입vLLM이 Pixtral 모델에서 멀티모달 인코더 어텐션의 성능과 메모리 효율성을 개선합니다.#vLLM#Pixtral#멀티모달#어텐션#최적화#성능 개선2026년 8월 26일댓글 수 로딩 중
[vllm] vLLM MoE 성능 최적화: flashinfer_nvlink_one_sided 도입vLLM의 MoE 통신 백엔드를 flashinfer_nvlink_one_sided로 기본 설정하여 처리량(Throughput)을 최대 8% 향상시켰습니다.#vLLM#MoE#FlashInfer#NVLink#Performance2026년 8월 26일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 NVFP4 어텐션 최적화: N64 스코어-슬롯 재사용을 통한 성능 향상FlashInfer의 SM120 NVFP4 어텐션 커널을 최적화하여 N64 스코어-슬롯 재사용으로 성능을 크게 향상시켰습니다.#FlashInfer#CUDA#NVIDIA#LLM#최적화#어텐션#NVFP4#SM1202026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer: Blackwell 아키텍처를 위한 Recurrent-KDA Prefill 최적화Blackwell GPU에서 Recurrent-KDA prefill 성능을 2.6배 이상 향상시킨 2단계 BT16 포트폴리오 도입 및 최적화 분석.#FlashInfer#Blackwell#CUDA#LLM#Performance2026년 8월 25일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 고성능 Paged MQA Logits 커널 도입Blackwell SM100 GPU에서 DeepSeek MLA를 위한 FP8/FP4 Paged MQA Logits 커널을 최적화하고 도입했습니다.#FlashInfer#Blackwell#CUDA#LLM#KernelOptimization2026년 8월 25일댓글 수 로딩 중
[flashinfer] FlashInfer GDN 커널의 SM90/SM120 비-CP 런치 오버헤드 감소 최적화 분석FlashInfer GDN 커널에서 SM90/SM120 GPU의 비-CP 런치 오버헤드를 줄여 성능을 개선한 PR 분석입니다.#FlashInfer#GDN#최적화#성능 개선#CUDA#TVM2026년 8월 24일댓글 수 로딩 중
[open-webui] Open WebUI 스트리밍 성능 190배 개선: O(N^2)에서 O(N)으로의 최적화스트리밍 응답 처리 시 매번 전체 텍스트를 재스캔하던 비효율을 제거하여 성능을 190배 향상시킨 사례를 분석합니다.#Python#Performance#Optimization#Open-WebUI#Streaming2026년 8월 24일댓글 수 로딩 중
[sglang] LingBot Video 성능 개선: 수동 RMSNorm 체인을 Triton 커널로 최적화하기LingBot Video의 수동 RMSNorm 연산을 Triton 커널로 대체하여 성능을 25% 이상 향상시킨 PR 분석#sglang#diffusion#optimization#Triton#RMSNorm#performance2026년 8월 24일댓글 수 로딩 중
[triton] Triton 컴파일러의 Reduce 연산 최적화: OptimizeThreadLocality 개선 분석Triton의 Reduce 연산 패턴 매칭을 재설계하여 컴파일러 최적화 범위를 확장하고 버그를 수정한 사례를 분석합니다.#Triton#Compiler#Optimization#GPU#MLIR2026년 8월 24일댓글 수 로딩 중
[openclaw] OpenConnect Gateway 성능 최적화: 연결 ID 기반 인덱싱 도입OpenConnect Gateway의 WebSocket 통신 성능을 개선하기 위해 연결 ID 기반 인덱싱을 도입한 PR 분석.#performance#optimization#backend#websocket#golang2026년 8월 23일댓글 수 로딩 중
[flashinfer] FlashInfer의 SM100/SM103 최적화: CAKE 기반 블록 희소 어텐션(VSA) 도입CAKE IR을 활용한 SM100/SM103 아키텍처용 고성능 블록 희소 어텐션(VSA) 커널 도입 및 성능 최적화 분석#FlashInfer#CUDA#Attention#Optimization#SM100#CAKE2026년 8월 23일댓글 수 로딩 중
[starlette] 신뢰할 수 있는 성능 측정을 위한 전략: Starlette의 벤치마크 안정화 기법PYTHONHASHSEED 고정과 전략적 Warmup을 통해 벤치마크의 노이즈를 제거하고 측정 정밀도를 높이는 방법을 분석합니다.#Python#Starlette#Benchmark#Optimization#CodSpeed2026년 8월 23일댓글 수 로딩 중
[starlette] 벤치마크 일관성 확보: glibc CPU Dispatch 최적화로 GitHub Actions Runner 분산 줄이기GitHub Actions 벤치마크의 일관성을 위해 glibc CPU dispatch를 AVX2로 고정하여 측정 분산을 줄이는 방법을 알아봅니다.#GitHub Actions#Benchmark#glibc#AVX512#AVX2#Performance Optimization#CI/CD2026년 8월 23일댓글 수 로딩 중
[openclaw] 대규모 세션 카탈로그 업데이트 성능 최적화: 전체 비교에서 부분 비교로불필요한 전체 카탈로그 직렬화 및 비교를 제거하여 UI 스톨을 95% 개선한 사례를 분석합니다.#Performance#TypeScript#Optimization#Frontend2026년 8월 22일댓글 수 로딩 중
[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ARM NEON 최적화: LinearAttention 커널 융합으로 3배 성능 향상Microsoft ONNX-Runtime의 LinearAttention 연산에 ARM NEON 최적화 커널을 추가하여 성능을 3배 향상시킨 PR을 분석합니다.#ONNX Runtime#ARM NEON#성능 최적화#MLAS#Linear Attention2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 ARM SVE i8mm QGEMM 최적화: 휴대용 머신 코드 전략ARM SVE i8mm 명령어를 활용한 고성능 QGEMM 커널 구현과 휴대용 머신 코드(Portable Machine Code)를 통한 이식성 확보 전략을 분석합니다.#ONNX Runtime#ARM#SVE#QGEMM#Optimization#AArch642026년 8월 22일댓글 수 로딩 중
[vllm] [vLLM] DFlash2: Speculative Decoding의 새로운 지평 - Local Conv와 Candidate Selector 분석vLLM에 도입된 DFlash2의 핵심 최적화 기법인 Grouped Conv와 Candidate Selector를 심층 분석합니다.#vLLM#Speculative Decoding#Triton#CUDA#LLM Serving2026년 8월 21일댓글 수 로딩 중
[ultralytics] Ultralytics 체크포인트 로딩 최적화 및 스레드 안전성 강화Restricted checkpoint 로딩의 스레드 안전성을 확보하고, RLE prior 계산을 최적화하여 성능을 40% 향상시켰습니다.#PyTorch#Performance#Concurrency#Optimization#Ultralytics2026년 8월 21일댓글 수 로딩 중