[flashinfer] FlashInfer KDA: BF16 준비된 Prefill 계획 캐싱 및 FP32 중간 상태 최적화 분석FlashInfer KDA의 BF16 준비된 Prefill 계획 캐싱 및 FP32 중간 상태 최적화 분석#FlashInfer#KDA#BF16#FP32#최적화#성능#LLM2026년 9월 25일댓글 수 로딩 중
[논문리뷰] How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus본 논문은 autoregressive (AR) 언어 모델의 디코딩 절차가 본질적으로 순차적이어서 높은 inference 비용과 제한된 하드웨어 활용을 초래하는 문제를 다룹니다.#Review#Lossless Speculative Decoding#Orthrus#Numerical Precision#BF16#FP32#Trajectory Divergence#Inference Acceleration#Perplexity2026년 9월 14일댓글 수 로딩 중