[sglang] DeepSeek-V4 Flash 공식 모델 최적화: H200 및 B200을 위한 SGLang 서빙 전략SGLang v0.5.16에서 DeepSeek-V4 Flash 공식 모델의 H200/B200 최적화 설정과 검증된 벤치마크 결과를 분석합니다.#SGLang#DeepSeek-V4#H200#B200#LLM-Serving#Optimization2026년 8월 1일댓글 수 로딩 중
[sglang] SGLang에서 Qwen3-Next FP8 MoE 최적화: H200을 위한 Shared-Expert FusionH200 환경에서 Qwen3-Next FP8 MoE 모델의 성능을 극대화하기 위한 Shared-Expert Fusion 및 Triton 커널 최적화 분석.#SGLang#LLM#MoE#FP8#Triton#H2002026년 6월 11일댓글 수 로딩 중
[sglang] SGLang의 add_constant 커널 최적화: 아키텍처 인지 벡터화(Vectorization) 도입대규모 텐서 연산 시 벡터화된 커널을 사용하여 add_constant 성능을 최대 35% 향상시키는 최적화 기법을 분석합니다.#SGLang#CUDA#KernelOptimization#Vectorization#H2002026년 5월 30일댓글 수 로딩 중