[sglang] SGLang에서 NPU를 위한 LTX-2/2.3 추론 성능 최적화 및 호환성 개선NPU 환경에서의 LTX-2/2.3 추론을 위해 float64 지원 제한 해결 및 커스텀 커널 최적화를 수행하여 성능을 10% 이상 향상했습니다.#SGLang#NPU#LTX-2#Triton#Inference Optimization2026년 9월 9일댓글 수 로딩 중
[논문리뷰] The Attention Triangle in Audio-Video Models본 논문은 Audio-Video Diffusion Models에서 Cross-modal Attention 메커니즘이 유발하는 Semantic Leakage 문제를 해결하고자 합니다.#Review#Audio-Video Diffusion Models#Attention Triangle#Semantic Leakage#Cross-modal Attention#Source Attribution#Inference-time Steering#LTX-22026년 9월 6일댓글 수 로딩 중
[sglang] SGLang LTX-2 모델을 위한 Breakable CUDA Graph 최적화 분석LTX-2 모델의 Breakable CUDA Graph 지원을 통해 H200 환경에서 추론 속도를 1.56배 향상시킨 최적화 기법을 분석합니다.#SGLang#CUDA Graph#LTX-2#Performance Optimization#LLM Serving2026년 8월 7일댓글 수 로딩 중
[sglang] SGLang LTX-2 최적화: LoRA 병합 오버헤드 제거를 통한 추론 성능 향상LTX-2 모델의 stage-1 distilled LoRA를 베이스 모델에 사전 병합하여, 요청마다 발생하는 병합/해제 오버헤드를 제거했습니다.#SGLang#LTX-2#LoRA#Optimization#Inference2026년 6월 19일댓글 수 로딩 중
[sglang] LTX-2 모델 성능 최적화: NPU 및 GPU에서의 지연 시간 단축 분석LTX-2 모델의 E2E 지연 시간을 NPU에서 27%, GPU에서 3% 단축한 코드 변경 분석.#sglang#LTX-2#성능 최적화#NPU#GPU#RMSNorm#FlashAttention2026년 6월 19일댓글 수 로딩 중