[onnxruntime] ONNX Runtime, SM90 GPU를 위한 네이티브 FP8 행렬 곱셈 최적화 도입ONNX Runtime이 SM90 GPU에서 MatMulBlockQuantizedFp8Weight 연산자를 위한 네이티브 FP8 행렬 곱셈 경로를 도입하여 성능을 크게 향상시켰습니다.#ONNX Runtime#CUDA#FP8#SM90#DeepGEMM#최적화#성능2026년 9월 16일댓글 수 로딩 중
[vllm] vLLM에서 DeepSeek V4.1을 위한 Mega-mHC 커널 최적화DeepGEMM 기반의 Mega-mHC 커널을 통합하여 DeepSeek V4.1 모델의 추론 성능을 최대 1.5배 향상시켰습니다.#vLLM#DeepSeek#DeepGEMM#KernelOptimization#LLM2026년 9월 15일댓글 수 로딩 중