[onnxruntime] [CUDA] NVFP4 QMoE GEMV 최적화: ALU 바운드 커널의 한계를 넘어서는 방법NVFP4 양자화 디코딩 속도를 30% 이상 개선하고, MTP 검증 성능을 20배 이상 끌어올린 ONNX Runtime의 최적화 기법을 분석합니다.#CUDA#ONNXRuntime#LLM#Optimization#NVFP4#MoE2026년 8월 6일댓글 수 로딩 중
[onnxruntime] [CUDA] QMoE MXFP4/NVFP4 가중치 역양자화 성능 최적화: Coalesced Memory Access의 힘ONNX Runtime의 QMoE 가중치 역양자화 커널을 Coalesced Memory Access 패턴으로 최적화하여 MoE 모델의 추론 속도를 대폭 향상시킨 PR 분석.#CUDA#ONNXRuntime#MoE#Optimization#GPU#DeepLearning#FP4#Dequantization#MemoryAccess2026년 8월 3일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU EP: 디바이스 없는 오프라인 컴파일 지원WebGPU EP에서 하드웨어 없이 모델을 최적화하고 직렬화할 수 있는 'Compile-only' 세션 모드를 구현하여 보안 및 샌드박스 환경을 지원합니다.#ONNXRuntime#WebGPU#Optimization#Compiler#Security2026년 7월 31일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Blackwell (SM120+)에서 NVFP4 QMoE를 위한 네이티브 FP4xFP4 Prefill 최적화ONNX Runtime이 Blackwell GPU에서 NVFP4 QMoE의 FP4xFP4 prefill 경로를 최적화하고, SM120 빌드 오류를 해결한 PR 분석.#ONNXRuntime#CUDA#FP4#Quantization#Blackwell#SM120#CUTLASS#Optimization#MoE2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: fpA_intB GEMM 최적화 및 CUDA 그래프 호환성 강화CUDA 환경에서 fpA_intB GEMM을 기본 활성화하고, 프로파일러의 병렬성 및 CUDA 그래프 안정성을 개선한 변경사항을 살펴봅니다.#ONNXRuntime#CUDA#GEMM#Quantization#Performance2026년 7월 17일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: FlashAttentionDecodeQKV 성능 최적화 분석WebGPU EP에서 FlashAttentionDecodeQKV의 Workgroup 크기와 타일링 전략을 최적화하여 토큰 생성 속도를 약 10% 향상시킨 사례를 분석합니다.#ONNXRuntime#WebGPU#FlashAttention#PerformanceOptimization#LLM2026년 7월 9일댓글 수 로딩 중
[onnxruntime] ONNX Runtime QMoE SwiGLU GEMV 최적화: Split-K2 커널로 LLM 추론 가속화ONNX Runtime의 Split-K2 SwiGLU GEMV 커널로 QMoE FC1 레이어 성능을 개선합니다.#ONNXRuntime#CUDA#GEMV#Split-K2#LLM#Optimization#SwiGLU#QMoE2026년 6월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: Reduce 연산 최적화를 통한 성능 향상WebGPU 환경에서 ReduceMean 연산 시 발생하는 불필요한 Transpose 오버헤드를 제거하여 모델 추론 속도를 개선한 사례를 분석합니다.#ONNXRuntime#WebGPU#Optimization#Performance#GPGPU2026년 6월 16일댓글 수 로딩 중
[onnxruntime] WebGPU 성능 최적화: Graph Capture 재사용을 위한 Session-level Buffer Pool 도입ONNX Runtime WebGPU EP에서 그래프 캡처 시 발생하는 버퍼 재할당 오버헤드를 줄이기 위한 세션 레벨 버퍼 풀링 기법 분석#WebGPU#ONNXRuntime#Performance#GraphCapture#GenAI2026년 6월 10일댓글 수 로딩 중
[onnxruntime] ONNX Runtime CPU ScatterElements 커널의 멀티스레딩 최적화 분석CPU ScatterElements 연산을 ThreadPool을 활용해 병렬화하여 129배의 성능 향상을 달성한 사례를 분석합니다.#ONNXRuntime#C++#Optimization#MultiThreading#Performance2026년 5월 22일댓글 수 로딩 중
[onnxruntime] Apple M4 Max를 위한 FlashAttention 최적화: 20배 성능 향상 분석WebGPU 기반 FlashAttention을 Apple 실리콘 환경에 맞춰 튜닝하여 최대 20배의 성능 향상을 달성한 기술적 접근을 분석합니다.#ONNXRuntime#WebGPU#FlashAttention#AppleSilicon#PerformanceOptimization2026년 5월 14일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] PagedAttention의 FA 경로 최적화 및 정확성 개선PagedAttention의 FA 경로에서 휴리스틱 기반 max_query_len을 실제 계산값으로 대체하여 성능 향상 및 CUDA 오류를 해결했습니다.#ONNXRuntime#CUDA#FlashAttention#Optimization#LLM2026년 5월 12일댓글 수 로딩 중
[onnxruntime] ONNX Runtime의 RISC-V Vector(RVV) 최적화: SGEMM과 Softmax 성능을 3배로 끌어올리기RISC-V 아키텍처에서 스칼라 연산에 의존하던 ONNX Runtime이 RVV 확장을 통해 SGEMM 및 Softmax 연산 성능을 최대 3.6배 개선했습니다.#ONNXRuntime#RISC-V#RVV#Optimization#MLAS#SIMD2026년 4월 30일댓글 수 로딩 중