[flashinfer] FlashInfer, 통신 최적화를 통한 LLM 추론 속도 향상: Ulysses Head-Chunk Primitives 도입FlashInfer가 Ulysses Head-Chunk Primitives를 도입하여 LLM 추론 시 통신 오버헤드를 줄이고 성능을 개선했습니다.#FlashInfer#LLM#추론 최적화#통신 최적화#Ulysses#Head-Chunk2026년 9월 14일댓글 수 로딩 중
[ollama] Ollama, DFlash를 통한 추론 속도 향상: 블록 단위 추론의 힘Ollama가 DFlash를 도입하여 모델 추론 시 블록 단위 토큰 생성을 통해 속도를 크게 개선했습니다.#Ollama#MLX#추론 최적화#DFlash#LLM2026년 8월 8일댓글 수 로딩 중