[onnxruntime] ONNX Runtime, x86 CPU에서 FP16 LayerNorm 및 RMSNorm 성능 최적화: AVX2 활용ONNX Runtime이 x86 CPU에서 FP16 LayerNorm 및 RMSNorm 연산의 성능을 AVX2, FMA, F16C 명령어셋을 활용하여 대폭 개선했습니다.#ONNX Runtime#CPU 최적화#FP16#LayerNorm#RMSNorm#AVX2#MLAS2026년 9월 25일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA EP, 2-bit 양자화 GEMM/GEMV 지원 추가로 모델 경량화 가속ONNX Runtime CUDA EP가 2-bit 양자화 가중치 지원을 추가하여 MatMul 연산 성능을 크게 향상시켰습니다.#ONNX Runtime#CUDA#Quantization#GEMM#GEMV#Optimization#Deep Learning2026년 9월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA 데이터 로딩 최적화: Pinned Buffer와 병렬 I/O를 통한 성능 개선CUDA 외부 데이터 로딩 시 Pinned Buffer와 병렬 읽기를 도입하여 모델 로딩 속도를 최대 29.8% 향상시킨 최적화 기법을 분석합니다.#ONNX Runtime#CUDA#Performance Optimization#Pinned Memory#Parallel I/O2026년 9월 18일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 RISC-V RVV 커널 최적화: 추론 성능 극대화RISC-V Vector(RVV) 확장을 활용하여 Softmax, Convolution, Activation 연산을 최적화하고 추론 속도를 최대 3배 향상시킨 사례 분석.#ONNX Runtime#RISC-V#RVV#Performance Optimization#Inference2026년 9월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime MoE 최적화: QMoE CPU GEMM 성능 대폭 향상ONNX Runtime에서 MoE 모델의 CPU 추론 성능을 획기적으로 개선하는 최적화 기법을 소개합니다.#ONNX Runtime#MoE#CPU 최적화#GEMM#양자화2026년 9월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime, SM90 GPU를 위한 네이티브 FP8 행렬 곱셈 최적화 도입ONNX Runtime이 SM90 GPU에서 MatMulBlockQuantizedFp8Weight 연산자를 위한 네이티브 FP8 행렬 곱셈 경로를 도입하여 성능을 크게 향상시켰습니다.#ONNX Runtime#CUDA#FP8#SM90#DeepGEMM#최적화#성능2026년 9월 16일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: NHWC Depthwise Convolution 최적화 분석WebGPU 환경에서 NHWC Depthwise Convolution을 벡터화하여 성능을 개선한 최적화 기법을 분석합니다.#ONNX Runtime#WebGPU#Optimization#Convolution#Performance2026년 9월 15일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: INT4 Paged KV Cache 도입을 통한 메모리 최적화INT4 Paged KV Cache를 도입하여 LLM의 긴 컨텍스트 처리 시 메모리 사용량을 절반으로 줄이고 성능을 극대화했습니다.#ONNX Runtime#CUDA#LLM#Optimization#Quantization2026년 9월 10일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA: int64 CumSum 연산 9배 가속화 최적화 분석CUB BlockScan을 활용하여 low-lane int64 CumSum 연산을 O(N^2)에서 O(N)으로 개선한 사례 분석#ONNX Runtime#CUDA#GPGPU#Performance#CUB2026년 9월 2일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU int4 가중치 프리패킹 최적화: 병렬 처리 효율성 개선ONNX Runtime에서 int4 양자화 모델 로딩 시 CPU 프리패킹 병렬화를 개선하여 세션 생성 속도를 약 25% 향상시켰습니다.#ONNX Runtime#Performance Optimization#CPU#Quantization#Parallelization2026년 9월 1일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA 커널 최적화: Speculative Decoding을 위한 GEMV 확장ONNX Runtime의 CUDA GEMV 커널을 확장하여 Speculative Decoding 시 M=64까지 고성능 경로를 유지하도록 최적화한 사례 분석.#ONNX Runtime#CUDA#GEMV#Speculative Decoding#Performance Optimization2026년 8월 30일댓글 수 로딩 중
[onnxruntime] ARM NEON 최적화: LinearAttention 커널 융합으로 3배 성능 향상Microsoft ONNX-Runtime의 LinearAttention 연산에 ARM NEON 최적화 커널을 추가하여 성능을 3배 향상시킨 PR을 분석합니다.#ONNX Runtime#ARM NEON#성능 최적화#MLAS#Linear Attention2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 ARM SVE i8mm QGEMM 최적화: 휴대용 머신 코드 전략ARM SVE i8mm 명령어를 활용한 고성능 QGEMM 커널 구현과 휴대용 머신 코드(Portable Machine Code)를 통한 이식성 확보 전략을 분석합니다.#ONNX Runtime#ARM#SVE#QGEMM#Optimization#AArch642026년 8월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime MLAS, AVX-512 최적화로 MobileClip-S0 모델 추론 속도 향상ONNX Runtime MLAS가 AVX-512 명령어셋을 활용하여 Erf 커널과 NCHWc 재정렬 트랜스포즈를 최적화했습니다.#ONNX Runtime#MLAS#AVX-512#최적화#성능#CPU 추론2026년 8월 21일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA ArgMax/ArgMin 연산 최적화: 대규모 행렬 병렬 처리 개선단일 스레드 기반의 ArgMax/ArgMin 연산을 협력적 병렬 처리로 개선하여 대규모 행렬에서 최대 1000배 이상의 성능 향상을 달성했습니다.#CUDA#ONNX Runtime#GPU Optimization#Performance#Parallel Computing2026년 8월 15일댓글 수 로딩 중
[onnxruntime] WebGPU MatMulNBits 최적화: Subgroup Shuffle을 활용한 성능 향상WebGPU MatMulNBits 커널에서 Subgroup Shuffle을 도입하여 A 피연산자의 중복 메모리 읽기를 줄이고 성능을 크게 향상시킨 PR 분석#WebGPU#ONNX Runtime#MatMulNBits#Optimization#WGSL#Subgroup Shuffle2026년 8월 13일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] CPU GQA 성능의 한계를 넘다: FP16 입력과 양자화된 KV 캐시 최적화 분석FP16 활성화 함수와 INT8/INT4 KV 캐시를 결합하여 CPU 추론 성능을 극대화한 ONNX Runtime의 최신 GQA 최적화 기법을 살펴봅니다.#ONNX Runtime#LLM Optimization#CPU Inference#SIMD#C++2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Arm64 KleidiAI 기반 FP16 GEMM 및 Convolution 최적화Arm64 환경에서 KleidiAI를 활용한 FP16 GEMM 및 Convolution 연산 가속화 및 MLAS API 확장#ONNX Runtime#Arm64#KleidiAI#FP16#Optimization2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: AVX2 및 AVX-VNNI를 위한 2-bit 가중치 CPU 커널 최적화AVX2/AVX-VNNI 환경에서 2-bit 가중치 MatMul 성능을 개선하여 기존 dequant+SGEMM 대비 최대 1.56배 성능 향상을 달성했습니다.#ONNX Runtime#MLAS#AVX2#VNNI#Optimization#MatMul2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: Intel Xe-3LPG를 위한 고성능 GEMM 최적화 분석Intel Xe-3LPG 아키텍처에서 vec4 로드와 B 타일 더블 버퍼링을 통해 GEMM 성능을 평균 12.7% 향상시킨 최적화 기법을 분석합니다.#WebGPU#ONNX Runtime#GEMM#GPU Optimization#Intel Xe-3LPG2026년 7월 8일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] SGEMM의 함정에서 벗어나기: GQA 전용 GEMV 커널을 통한 디코딩 최적화ONNX Runtime에서 M=1인 디코딩 상황의 SGEMM 오버헤드를 해결하고, 전용 GEMV 커널로 GQA 성능을 최대 1.5배 끌어올린 최적화 사례를 분석합니다.#ONNX Runtime#GQA#Performance Optimization#GEMV#LLM Inference2026년 6월 26일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: MoE Router GEMV 최적화 및 Bias Fusion 구현GPT-OSS-20B 모델의 MoE 라우터 성능 향상을 위해 MatMulNBits 커널에 특화된 GEMV 경로와 Bias Fusion을 도입했습니다.#ONNX Runtime#CUDA#MoE#GEMV#Optimization2026년 6월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA MoE: 소규모 배치 디코딩을 위한 SoftmaxTopK 라우터 최적화ONNX Runtime CUDA MoE에서 소규모 배치 디코딩 시 SoftmaxTopK 라우터 성능을 개선하는 방법을 기술합니다.#ONNX Runtime#CUDA#MoE#최적화#성능2026년 6월 12일댓글 수 로딩 중
[onnxruntime] WebGPU FlashAttention 최적화: 커널 퓨전과 가변 시퀀스 길이 지원으로 성능 극대화WebGPU FlashAttention의 커널 퓨전과 가변 시퀀스 길이 지원을 통한 성능 개선 분석#WebGPU#FlashAttention#ONNX Runtime#최적화#성능 개선#AI 가속2026년 6월 11일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA Graph: 진정한 비동기 추론을 위한 동기화 지점 제거CUDA Graph Replay 시 강제되던 동기화 지점을 제거하여, IO Binding과 함께 완전한 비동기 GPU 추론 파이프라인을 구축하는 최적화 기법을 소개합니다.#ONNX Runtime#CUDA#Performance Optimization#Async Inference#CUDA Graph2026년 6월 2일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU GQA 최적화: Flash Attention과 Flash Decoding 도입CPU 환경에서 INT8/INT4 양자화된 KV 캐시를 위한 Flash Attention 기반의 타일링 및 Flash Decoding 구현으로 성능을 극대화합니다.#ONNX Runtime#LLM#Flash Attention#CPU Optimization#Quantization2026년 5월 29일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUTLASS FMHA: BiasLoader 정렬 문제 해결로 안정성 및 호환성 향상ONNX Runtime의 CUTLASS FMHA에서 BiasLoader의 정렬 문제를 해결하여 CUDA 커널의 안정성과 호환성을 개선했습니다.#ONNX Runtime#CUDA#CUTLASS#FMHA#최적화#성능2026년 5월 27일댓글 수 로딩 중
[onnxruntime] RISC-V 벡터(RVV) 최적화: ONNX Runtime LLM 추론 성능 극대화RISC-V 벡터 확장을 활용하여 LLM 연산자(GEMM, LayerNorm, RoPE)의 성능을 최대 191배 향상시킨 최적화 사례를 분석합니다.#RISC-V#RVV#ONNX Runtime#LLM#Optimization2026년 5월 23일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CPU GQA 최적화: INT8/INT4 양자화 KV 캐시와 SIMD 가속CPU 환경에서 LLM 추론 성능을 극대화하기 위해 INT8/INT4 양자화 KV 캐시와 AVX512/NEON SIMD 커널을 도입한 최적화 사례를 분석합니다.#ONNX Runtime#LLM#Quantization#SIMD#Performance2026년 5월 21일댓글 수 로딩 중
[onnxruntime] ONNX Runtime 스레드 풀의 지능형 대기: Exponential Backoff 도입으로 성능 및 전력 효율성 향상ONNX Runtime 스레드 풀의 스핀 루프에 Exponential Backoff를 도입하여 성능과 전력 효율성을 개선하는 방법을 분석합니다.#ONNX Runtime#성능 최적화#스레드 풀#Exponential Backoff#병렬 처리2026년 4월 24일댓글 수 로딩 중