[flashinfer] FlashInfer, 통신 최적화를 통한 LLM 추론 속도 향상: Ulysses Head-Chunk Primitives 도입FlashInfer가 Ulysses Head-Chunk Primitives를 도입하여 LLM 추론 시 통신 오버헤드를 줄이고 성능을 개선했습니다.#FlashInfer#LLM#추론 최적화#통신 최적화#Ulysses#Head-Chunk2026년 9월 14일댓글 수 로딩 중