[flashinfer] FlashInfer의 GDN 커널 런칭 오버헤드 80% 절감하기: 호스트 측 최적화 전략FlashInfer의 GDN 커널 런칭 오버헤드를 캐싱 전략을 통해 434.7us에서 98.2us로 80% 개선한 사례를 분석합니다.#FlashInfer#CUDA#Optimization#Performance#CUTE2026년 8월 11일댓글 수 로딩 중