[flashinfer] FlashInfer의 Context-Parallel Decode 최적화: Fused A2A + LSE ReduceNCCL LSA를 활용하여 All-to-All 통신과 LSE 가중치 병합을 하나의 CUDA 커널로 융합해 성능을 극대화한 기술 분석.#FlashInfer#CUDA#NCCL#LLM#Context-Parallel2026년 9월 21일댓글 수 로딩 중