[flashinfer] SM120(Blackwell)을 위한 초고속 KDA Prefill 커널: FlashInfer의 CuTe DSL 백엔드 분석SM120 아키텍처에서 CuTe DSL을 활용해 KDA Prefill 성능을 3.2배 향상시킨 최적화 기법과 안정성 개선 사항을 살펴봅니다.#FlashInfer#CUDA#Blackwell#KDA#Performance-Optimization#CuTe-DSL2026년 8월 22일댓글 수 로딩 중
[flashinfer] FlashInfer: B200용 최적화된 Recurrent KDA Prefill 백엔드 도입NVIDIA B200(SM100a) 아키텍처를 위한 고성능 Recurrent KDA Prefill 백엔드 추가 및 성능 최적화 분석#FlashInfer#B200#CUDA#KDA#Performance2026년 8월 3일댓글 수 로딩 중
[sglang] SGLang에 KDA FlashInfer 백엔드 도입: Blackwell 아키텍처에서의 효율적인 추론FlashInfer KDA 커널을 도입하여 KDA 모델의 추론 성능을 개선하고 MTP(Speculative Decoding)를 위한 target_verify 경로를 구현했습니다.#SGLang#FlashInfer#KDA#Speculative Decoding#LLM Optimization2026년 7월 15일댓글 수 로딩 중
[SGLang] KDA (Kernel-Driven Attention): 커널 기반 선형 어텐션SGLang의 KDA 선형 어텐션을 분석한다. 커널 함수를 활용한 선형 시간 어텐션, Triton/CutEDSL 커널 구현을 코드와 함께 살펴본다.#sglang#KDA#Kernel-Driven Attention#Linear Attention2026년 4월 11일댓글 수 로딩 중