[onnxruntime] ONNX Runtime MLAS, AVX-512 최적화로 MobileClip-S0 모델 추론 속도 향상ONNX Runtime MLAS가 AVX-512 명령어셋을 활용하여 Erf 커널과 NCHWc 재정렬 트랜스포즈를 최적화했습니다.#ONNX Runtime#MLAS#AVX-512#최적화#성능#CPU 추론2026년 8월 21일댓글 수 로딩 중
[Liger-Kernel] Liger-Kernel의 RMSNorm 최적화: cuTile 도입과 CuTe DSL 성능 개선Liger-Kernel에 네이티브 cuTile RMSNorm을 추가하고, CuTe DSL의 동기화 및 연산 효율을 최적화하여 H100 성능을 극대화했습니다.#CUDA#RMSNorm#Liger-Kernel#CuTe#H100#Performance2026년 8월 21일댓글 수 로딩 중
[LlamaFactory] Qwen3.5 모델의 GDN 선형 어텐션에 대한 시퀀스 병렬 처리 및 Pack 지원 추가Qwen3.5 모델의 GDN 선형 어텐션 레이어에 시퀀스 병렬 처리와 Pack 기능을 적용하여 GPU 활용도를 높였습니다.#LLM#Qwen3.5#Sequence Parallel#Context Parallel#GDN#Flash Attention#Optimization2026년 8월 20일댓글 수 로딩 중
[flashinfer] Blackwell 아키텍처를 위한 MXFP8/MXFP4 기반 고성능 MoE 추론 최적화FlashInfer의 SM100 W4A8 백엔드 추가로 MXFP8/MXFP4 혼합 정밀도 추론 성능 및 통신 효율 대폭 개선#FlashInfer#MoE#Blackwell#MXFP8#CuTeDSL#LLM2026년 8월 20일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 FlashInfer의 Router GEMM 최적화FlashInfer가 NVIDIA Blackwell GPU에서 Router GEMM 연산 성능을 1.1x 이상 향상시킨 최적화 PR 분석#NVIDIA Blackwell#Router GEMM#FlashInfer#GPU 최적화#성능 향상#딥러닝2026년 8월 20일댓글 수 로딩 중
[flashinfer] DeepSeek-V3 라우팅의 혁신: FlashInfer의 Cake 백엔드 가속 분석Blackwell 아키텍처에서 DeepSeek MoE 라우팅 성능을 최대 1.55배 끌어올린 Cake 백엔드의 PTX 최적화 기법을 살펴봅니다.#CUDA#DeepSeek#MoE#FlashInfer#Blackwell#Performance2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer에 NVIDIA Rubin(SM107) 및 Blackwell FP8 GEMM 지원 추가CuTe DSL을 활용한 NVIDIA Rubin 아키텍처 지원 및 Blackwell용 고성능 FP8 GEMM 커널 구현 최적화.#FlashInfer#NVIDIA#Rubin#Blackwell#GEMM#FP8#CuTeDSL2026년 8월 20일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer의 PrimTS를 활용한 고성능 Block-Sparse Attention 최적화NVIDIA Blackwell 아키텍처를 위한 Q64/KV256 프로파일 및 Paged Block-Sparse Attention 구현으로 성능 극대화#FlashInfer#Attention#CUDA#GPU#LLM2026년 8월 19일댓글 수 로딩 중
[loki] Grafana Loki 성능 최적화: 파일 핸들 풀링을 통한 I/O 오버헤드 개선Grafana Loki의 TSDB 인덱스 읽기 성능을 높이기 위해 파일 핸들 풀링을 도입하여 I/O 비용을 획기적으로 절감했습니다.#Grafana Loki#Golang#Performance#TSDB#I/O Optimization2026년 8월 19일댓글 수 로딩 중
[sglang] [AMD MI355X] DeepSeek-V4 최적화: FP8 Quantization의 불필요한 Copy 제거하기AMD MI355X 환경에서 FP8 Linear 레이어의 Scale Relayout Copy를 제거하여 최대 2%의 성능 향상을 끌어낸 최적화 사례를 분석합니다.#AMD#MI355X#DeepSeek-V4#FP8#Quantization#Performance-Optimization2026년 8월 19일댓글 수 로딩 중
[flashinfer] FlashInfer, SM100 아키텍처를 위한 BF16 x FP4 GEMM 최적화로 성능 극대화FlashInfer가 SM100 GPU를 위한 BF16 x FP4 GEMM 커널을 도입하여 추론 성능을 크게 향상시켰습니다.#FlashInfer#GEMM#BF16#FP4#NVIDIA GPU#최적화#딥러닝 추론2026년 8월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: DeepSeek-v4 SWA 인덱스 변환 Hoisting 및 백엔드 통합CUDA Graph 내부의 중복된 SWA 인덱스 변환을 제거하고 백엔드 간 버퍼 네이밍을 통일하여 유지보수성과 성능을 동시에 잡은 PR 분석#CUDA Graph#DeepSeek-v4#SGLang#Optimization#LLM2026년 8월 18일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V3.2 커널의 대규모 토큰 처리 안정성 강화vLLM의 DeepSeek V3.2 커널에서 발생하던 대규모 단일 반복 토큰 처리 오류를 해결하여 안정성을 높였습니다.#vLLM#Triton#CUDA#최적화#딥러닝2026년 8월 18일댓글 수 로딩 중
[sglang] MiniMax-H3 모델을 24GB GPU에서 가속화하는 INT8 양자화 및 플러그형 어텐션 최적화MiniMax-H3 모델을 24GB GPU에서 실행하기 위해 INT8 양자화와 플러그형 어텐션 백엔드를 도입하여 최대 2.48배 성능을 향상했습니다.#SGLang#Diffusion#Optimization#INT8#GPU2026년 8월 18일댓글 수 로딩 중
[cpython] CPython 성능 최적화: re.split의 리스트 빌드 과정 개선하기CPython의 re.split 구현에서 _PyList_AppendTakeRef를 사용하여 불필요한 참조 카운트 조작을 제거하고 성능을 향상시킨 사례를 분석합니다.#CPython#Python#Performance#Optimization#Internals2026년 8월 17일댓글 수 로딩 중
[cpython] Python 문자열 split/splitlines 성능 개선: _PyList_AppendTakeRef 도입Python 3.x의 문자열 split/splitlines 함수에서 불필요한 참조 카운트 연산을 제거하여 성능을 향상시킨 코드 변경 분석.#Python#CPython#Optimization#Performance#String Manipulation2026년 8월 17일댓글 수 로딩 중
[sglang] SGLang의 DeepSeek DSA 모델 최적화: Skip-TopK 레이어의 KV 캐시 효율화DeepSeek DSA 모델에서 불필요한 Indexer KV 캐시를 제거하여 메모리 효율을 16% 이상 향상시킨 최적화 사례를 분석합니다.#SGLang#DeepSeek#KV-Cache#LLM-Optimization#CUDA2026년 8월 17일댓글 수 로딩 중
[sglang] [AMD gfx950] GLM-5.2 MLA 최적화: FP8 양자화와 Zero-Copy 레이아웃 전환AMD MI355X 환경에서 GLM-5.2 모델의 MLA 연산을 FP8로 가속하고, 불필요한 메모리 복사를 제거하여 성능을 최대 14% 향상시킨 기법을 분석합니다.#AMD#ROCm#GLM-5.2#MLA#FP8#Performance-Optimization2026년 8월 17일댓글 수 로딩 중
[sglang] Sana 모델의 BCG 성능 향상: 비트-정확 Triton 커널을 활용한 컨볼루션 후처리 최적화Sana 모델의 BCG 후처리에서 컨볼루션 연산을 비트-정확 Triton 커널로 융합하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#Triton#Diffusion Models#Sana2026년 8월 16일댓글 수 로딩 중