[onnxruntime] ONNX Runtime, x86 CPU에서 FP16 LayerNorm 및 RMSNorm 성능 최적화: AVX2 활용ONNX Runtime이 x86 CPU에서 FP16 LayerNorm 및 RMSNorm 연산의 성능을 AVX2, FMA, F16C 명령어셋을 활용하여 대폭 개선했습니다.#ONNX Runtime#CPU 최적화#FP16#LayerNorm#RMSNorm#AVX2#MLAS2026년 9월 25일댓글 수 로딩 중
[onnxruntime] ARM NEON 최적화: LinearAttention 커널 융합으로 3배 성능 향상Microsoft ONNX-Runtime의 LinearAttention 연산에 ARM NEON 최적화 커널을 추가하여 성능을 3배 향상시킨 PR을 분석합니다.#ONNX Runtime#ARM NEON#성능 최적화#MLAS#Linear Attention2026년 8월 22일댓글 수 로딩 중
[onnxruntime] ONNX Runtime MLAS, AVX-512 최적화로 MobileClip-S0 모델 추론 속도 향상ONNX Runtime MLAS가 AVX-512 명령어셋을 활용하여 Erf 커널과 NCHWc 재정렬 트랜스포즈를 최적화했습니다.#ONNX Runtime#MLAS#AVX-512#최적화#성능#CPU 추론2026년 8월 21일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: AVX2 및 AVX-VNNI를 위한 2-bit 가중치 CPU 커널 최적화AVX2/AVX-VNNI 환경에서 2-bit 가중치 MatMul 성능을 개선하여 기존 dequant+SGEMM 대비 최대 1.56배 성능 향상을 달성했습니다.#ONNX Runtime#MLAS#AVX2#VNNI#Optimization#MatMul2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 RISC-V Vector(RVV) 최적화: SGEMM과 Softmax 성능을 3배로 끌어올리기RISC-V 아키텍처에서 스칼라 연산에 의존하던 ONNX Runtime이 RVV 확장을 통해 SGEMM 및 Softmax 연산 성능을 최대 3.6배 개선했습니다.#ONNXRuntime#RISC-V#RVV#Optimization#MLAS#SIMD2026년 4월 30일댓글 수 로딩 중