[onnxruntime] ONNX Runtime CUDA ArgMax/ArgMin 연산 최적화: 대규모 행렬 병렬 처리 개선단일 스레드 기반의 ArgMax/ArgMin 연산을 협력적 병렬 처리로 개선하여 대규모 행렬에서 최대 1000배 이상의 성능 향상을 달성했습니다.#CUDA#ONNX Runtime#GPU Optimization#Performance#Parallel Computing2026년 8월 15일댓글 수 로딩 중
[onnxruntime] WebGPU MatMulNBits 최적화: Subgroup Shuffle을 활용한 성능 향상WebGPU MatMulNBits 커널에서 Subgroup Shuffle을 도입하여 A 피연산자의 중복 메모리 읽기를 줄이고 성능을 크게 향상시킨 PR 분석#WebGPU#ONNX Runtime#MatMulNBits#Optimization#WGSL#Subgroup Shuffle2026년 8월 13일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 FP4/FP8 GEMV 커널 최적화: Tensor Core와 M-Tiling을 통한 성능 극대화ONNX Runtime의 FP4/FP8 GEMV 커널에 Tensor Core 활용 및 M-tiling을 도입하여 추론 성능을 최대 5배 향상시켰습니다.#ONNX Runtime#CUDA#GEMV#Tensor Core#FP4#FP8#LLM2026년 8월 1일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] CPU GQA 성능의 한계를 넘다: FP16 입력과 양자화된 KV 캐시 최적화 분석FP16 활성화 함수와 INT8/INT4 KV 캐시를 결합하여 CPU 추론 성능을 극대화한 ONNX Runtime의 최신 GQA 최적화 기법을 살펴봅니다.#ONNX Runtime#LLM Optimization#CPU Inference#SIMD#C++2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Arm64 KleidiAI 기반 FP16 GEMM 및 Convolution 최적화Arm64 환경에서 KleidiAI를 활용한 FP16 GEMM 및 Convolution 연산 가속화 및 MLAS API 확장#ONNX Runtime#Arm64#KleidiAI#FP16#Optimization2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: AVX2 및 AVX-VNNI를 위한 2-bit 가중치 CPU 커널 최적화AVX2/AVX-VNNI 환경에서 2-bit 가중치 MatMul 성능을 개선하여 기존 dequant+SGEMM 대비 최대 1.56배 성능 향상을 달성했습니다.#ONNX Runtime#MLAS#AVX2#VNNI#Optimization#MatMul2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: Intel Xe-3LPG를 위한 고성능 GEMM 최적화 분석Intel Xe-3LPG 아키텍처에서 vec4 로드와 B 타일 더블 버퍼링을 통해 GEMM 성능을 평균 12.7% 향상시킨 최적화 기법을 분석합니다.#WebGPU#ONNX Runtime#GEMM#GPU Optimization#Intel Xe-3LPG2026년 7월 8일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] SGEMM의 함정에서 벗어나기: GQA 전용 GEMV 커널을 통한 디코딩 최적화ONNX Runtime에서 M=1인 디코딩 상황의 SGEMM 오버헤드를 해결하고, 전용 GEMV 커널로 GQA 성능을 최대 1.5배 끌어올린 최적화 사례를 분석합니다.#ONNX Runtime#GQA#Performance Optimization#GEMV#LLM Inference2026년 6월 26일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: MoE Router GEMV 최적화 및 Bias Fusion 구현GPT-OSS-20B 모델의 MoE 라우터 성능 향상을 위해 MatMulNBits 커널에 특화된 GEMV 경로와 Bias Fusion을 도입했습니다.#ONNX Runtime#CUDA#MoE#GEMV#Optimization2026년 6월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA MoE: 소규모 배치 디코딩을 위한 SoftmaxTopK 라우터 최적화ONNX Runtime CUDA MoE에서 소규모 배치 디코딩 시 SoftmaxTopK 라우터 성능을 개선하는 방법을 기술합니다.#ONNX Runtime#CUDA#MoE#최적화#성능2026년 6월 12일댓글 수 로딩 중
[onnxruntime] WebGPU FlashAttention 최적화: 커널 퓨전과 가변 시퀀스 길이 지원으로 성능 극대화WebGPU FlashAttention의 커널 퓨전과 가변 시퀀스 길이 지원을 통한 성능 개선 분석#WebGPU#FlashAttention#ONNX Runtime#최적화#성능 개선#AI 가속2026년 6월 11일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUDA Graph: 진정한 비동기 추론을 위한 동기화 지점 제거CUDA Graph Replay 시 강제되던 동기화 지점을 제거하여, IO Binding과 함께 완전한 비동기 GPU 추론 파이프라인을 구축하는 최적화 기법을 소개합니다.#ONNX Runtime#CUDA#Performance Optimization#Async Inference#CUDA Graph2026년 6월 2일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 CPU GQA 최적화: Flash Attention과 Flash Decoding 도입CPU 환경에서 INT8/INT4 양자화된 KV 캐시를 위한 Flash Attention 기반의 타일링 및 Flash Decoding 구현으로 성능을 극대화합니다.#ONNX Runtime#LLM#Flash Attention#CPU Optimization#Quantization2026년 5월 29일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CUTLASS FMHA: BiasLoader 정렬 문제 해결로 안정성 및 호환성 향상ONNX Runtime의 CUTLASS FMHA에서 BiasLoader의 정렬 문제를 해결하여 CUDA 커널의 안정성과 호환성을 개선했습니다.#ONNX Runtime#CUDA#CUTLASS#FMHA#최적화#성능2026년 5월 27일댓글 수 로딩 중
[onnxruntime] RISC-V 벡터(RVV) 최적화: ONNX Runtime LLM 추론 성능 극대화RISC-V 벡터 확장을 활용하여 LLM 연산자(GEMM, LayerNorm, RoPE)의 성능을 최대 191배 향상시킨 최적화 사례를 분석합니다.#RISC-V#RVV#ONNX Runtime#LLM#Optimization2026년 5월 23일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CPU GQA 최적화: INT8/INT4 양자화 KV 캐시와 SIMD 가속CPU 환경에서 LLM 추론 성능을 극대화하기 위해 INT8/INT4 양자화 KV 캐시와 AVX512/NEON SIMD 커널을 도입한 최적화 사례를 분석합니다.#ONNX Runtime#LLM#Quantization#SIMD#Performance2026년 5월 21일댓글 수 로딩 중
[onnxruntime] ONNX Runtime 스레드 풀의 지능형 대기: Exponential Backoff 도입으로 성능 및 전력 효율성 향상ONNX Runtime 스레드 풀의 스핀 루프에 Exponential Backoff를 도입하여 성능과 전력 효율성을 개선하는 방법을 분석합니다.#ONNX Runtime#성능 최적화#스레드 풀#Exponential Backoff#병렬 처리2026년 4월 24일댓글 수 로딩 중