[vllm] vLLM의 대규모 모델 추론을 위한 MRV2 기반 Prefill Context Parallelism(PCP) 도입MLA 모델을 위한 MRV2 기반의 PCPManager를 도입하여 Prefill 연산을 병렬화하고, DCP와 PCP를 직교적으로 분리하여 확장성을 개선했습니다.#vLLM#LLM#MLA#Context Parallelism#Distributed Inference2026년 7월 19일댓글 수 로딩 중
[SGLang] gRPC 서버: 분산 추론을 위한 고성능 통신 계층SGLang의 gRPC 서버 구현을 분석한다. HTTP 대비 gRPC의 장점, Protobuf 메시지 정의, Streaming RPC를 통한 실시간 토큰 전달, 분산 환경에서의 활용 방식을 코드와 함께 살펴본다.#sglang#gRPC#Distributed Inference#Protobuf2026년 4월 9일댓글 수 로딩 중