[onnxruntime] ONNX Runtime, x86 CPU에서 FP16 LayerNorm 및 RMSNorm 성능 최적화: AVX2 활용ONNX Runtime이 x86 CPU에서 FP16 LayerNorm 및 RMSNorm 연산의 성능을 AVX2, FMA, F16C 명령어셋을 활용하여 대폭 개선했습니다.#ONNX Runtime#CPU 최적화#FP16#LayerNorm#RMSNorm#AVX2#MLAS2026년 9월 25일댓글 수 로딩 중
[ultralytics] Ultralytics YOLOv10 TensorRT 엔진 성능 최적화: FP16 및 INT8 속도 향상 비결TensorRT 엔진의 FP16 및 INT8 추론 속도를 최대 20%까지 향상시키는 최적화 기법을 분석합니다.#YOLOv10#TensorRT#Optimization#Performance#FP16#INT8#CUDA Graph2026년 9월 20일댓글 수 로딩 중
[flashinfer] NVIDIA SM110 GPU를 위한 실험적인 FP16 GQA 디코드 커널 추가NVIDIA SM110 GPU에 최적화된 실험적인 FP16 GQA 디코드 커널을 추가하여 성능을 개선했습니다.#NVIDIA#SM110#GQA#FP16#Decode Kernel#Performance Optimization#FlashInfer2026년 9월 9일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Arm64 KleidiAI 기반 FP16 GEMM 및 Convolution 최적화Arm64 환경에서 KleidiAI를 활용한 FP16 GEMM 및 Convolution 연산 가속화 및 MLAS API 확장#ONNX Runtime#Arm64#KleidiAI#FP16#Optimization2026년 7월 17일댓글 수 로딩 중
[논문리뷰] Defeating the Training-Inference Mismatch via FP16대규모 언어 모델(LLM)의 강화 학습(RL) 미세 조정 과정에서 발생하는 불안정성의 근본 원인인 훈련-추론 불일치(training-inference mismatch) 를 해결하는 것이 목표입니다.#Review#Reinforcement Learning#LLM Fine-tuning#Training-Inference Mismatch#Floating Point Precision#FP16#BF16#RL Stability2025년 11월 9일댓글 수 로딩 중