[vllm] [vLLM 성능 최적화] Nemotron-3 디코딩 속도를 13% 향상시킨 Latent-MoE All-Reduce 최적화 분석Nemotron-3 모델의 TP 환경에서 불필요한 All-Reduce를 제거하여 디코딩 성능을 13% 복구한 최적화 기법을 살펴봅니다.#vLLM#Nemotron#Performance#All-Reduce#MoE#Tensor-Parallelism2026년 9월 15일댓글 수 로딩 중
[논문리뷰] Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains본 연구는 Modern Greek이 주요 multilingual retrieval 벤치마크 및 Nemotron 모델의 지원 언어에서 제외되어, 전문 도메인에서의 RAG 성능이 검증되지 않는 문제를 해결하고자 합니다.#Review#Modern Greek#Retrieval-Augmented Generation (RAG)#Dense Retrieval#BM25#Nemotron#Cross-Encoder#HERA2026년 8월 6일댓글 수 로딩 중