[flashinfer] FlashInfer KDA: BF16 준비된 Prefill 계획 캐싱 및 FP32 중간 상태 최적화 분석FlashInfer KDA의 BF16 준비된 Prefill 계획 캐싱 및 FP32 중간 상태 최적화 분석#FlashInfer#KDA#BF16#FP32#최적화#성능#LLM2026년 9월 25일댓글 수 로딩 중
[flashinfer] FlashInfer, MiniMax-H3 어텐션 최적화: BF16 및 NVFP4 지원으로 성능 혁신FlashInfer의 MiniMax-H3 어텐션 최적화 PR 분석: BF16 및 NVFP4 지원으로 성능 향상 및 새로운 가능성 제시#FlashInfer#AI#딥러닝#최적화#GPU#어텐션 메커니즘#BF16#NVFP42026년 9월 24일댓글 수 로딩 중
[flashinfer] FlashInfer BF16 KDA 성능 최적화: M64 Value Split 도입FlashInfer의 BF16 KDA 연산에서 M64 Value Split을 활용하여 성능을 크게 향상시킨 PR 분석#FlashInfer#AI#성능 최적화#CUDA#BF16#LLM2026년 9월 21일댓글 수 로딩 중
[논문리뷰] How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus본 논문은 autoregressive (AR) 언어 모델의 디코딩 절차가 본질적으로 순차적이어서 높은 inference 비용과 제한된 하드웨어 활용을 초래하는 문제를 다룹니다.#Review#Lossless Speculative Decoding#Orthrus#Numerical Precision#BF16#FP32#Trajectory Divergence#Inference Acceleration#Perplexity2026년 9월 14일댓글 수 로딩 중
[flashinfer] FlashInfer, BF16 활성화 및 MXFP8 가중치에 대한 Cake MegaMoE EP16 백엔드 최적화FlashInfer의 실험적인 Cake MegaMoE EP16 백엔드가 BF16 활성화와 MXFP8 가중치에 대해 최적화되어 성능이 향상되었습니다.#FlashInfer#MegaMoE#MXFP8#BF16#최적화#성능#CUDA2026년 9월 12일댓글 수 로딩 중
[vllm] vLLM, FlashInfer BF16 CuTeDSL GEMM 통합으로 저지연 추론 성능 향상vLLM이 FlashInfer BF16 CuTeDSL GEMM을 통합하여 저지연 추론 성능을 개선했습니다.#vLLM#FlashInfer#BF16#GEMM#최적화#딥러닝 추론2026년 8월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, SM100 아키텍처를 위한 BF16 x FP4 GEMM 최적화로 성능 극대화FlashInfer가 SM100 GPU를 위한 BF16 x FP4 GEMM 커널을 도입하여 추론 성능을 크게 향상시켰습니다.#FlashInfer#GEMM#BF16#FP4#NVIDIA GPU#최적화#딥러닝 추론2026년 8월 18일댓글 수 로딩 중
[axolotl] Axolotl, Marlin W4A16 도입으로 MoE 모델 추론 속도 1.79배 향상 및 품질 개선Axolotl이 Marlin W4A16 백엔드를 도입하여 MoE 모델의 추론 속도를 1.79배 높이고, 활성화 양자화 오류를 제거하여 모델 품질을 향상시켰습니다.#Axolotl#Marlin#MoE#DeepSeek-V4#W4A16#BF16#Quantization#Optimization#Deep Learning#LLM2026년 6월 20일댓글 수 로딩 중
[flashinfer] FlashInfer BF16 XQA MLA 커널의 10가지 버그 수정 및 최적화 분석FlashInfer의 BF16 XQA MLA 커널에서 발생한 10가지 치명적인 버그를 수정하고 성능을 개선한 PR을 분석합니다.#FlashInfer#CUDA#Kernel Optimization#BF16#XQA#MLA2026년 5월 7일댓글 수 로딩 중
[vllm] vLLM, Arm CPU의 BF16 GELU 연산을 LUT 기반 구현으로 8배 가속vLLM이 Arm CPU 환경에서 BF16 GELU 연산을 LUT 기반으로 구현하여 성능을 크게 향상시킨 PR 분석.#vLLM#Arm CPU#BF16#GELU#최적화#성능 개선#LUT2026년 4월 16일댓글 수 로딩 중
[논문리뷰] Defeating the Training-Inference Mismatch via FP16대규모 언어 모델(LLM)의 강화 학습(RL) 미세 조정 과정에서 발생하는 불안정성의 근본 원인인 훈련-추론 불일치(training-inference mismatch) 를 해결하는 것이 목표입니다.#Review#Reinforcement Learning#LLM Fine-tuning#Training-Inference Mismatch#Floating Point Precision#FP16#BF16#RL Stability2025년 11월 9일댓글 수 로딩 중
[논문리뷰] Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention본 논문은 저정밀도(low-precision) Flash Attention 을 사용하는 Transformer 모델 학습 시 발생하는 치명적인 손실 폭발(loss explosion) 현상의 기계론적 원인 을 규명하는 것을 목표로 합니다.#Review#Low-Precision Training#Flash Attention#Transformer#Numerical Stability#BF16#Rounding Error#Gradient Bias#Deep Learning Optimization2025년 10월 9일댓글 수 로딩 중