[vllm] vLLM DeepSeek-OCR-2 모델의 TTFT 성능 최적화 분석DeepSeek-OCR-2의 CPU 병목인 4D 마스크 생성 로직을 텐서 연산 및 캐싱으로 최적화하여 TTFT를 1.8배 개선했습니다.#vLLM#DeepSeek-OCR-2#Performance#TTFT#PyTorch2026년 7월 26일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: 과도한 Prefill CUDA Graph Padding 방지로 TTFT 개선SGLang이 과도한 Prefill CUDA Graph Padding을 방지하여 불필요한 연산을 줄이고 TTFT를 크게 개선한 최적화 과정을 분석합니다.#SGLang#CUDA Graph#LLM Serving#Performance Optimization#Prefill#TTFT#Python#Deep Learning2026년 7월 18일댓글 수 로딩 중
[Open WebUI] 모델 캐시 활용으로 TTFT(첫 토큰 도달 시간) 대폭 단축매 채팅 요청마다 모든 백엔드에서 모델 목록을 가져오던 get_all_models() 호출을 캐시 우선 조회로 변경하여 TTFT를 크게 개선한 PR을 분석합니다.#Open WebUI#Performance#Python#TTFT#Caching2026년 2월 12일댓글 수 로딩 중