[transformers] Hugging Face Transformers의 Flash Attention 성능 회귀(Regression) 해결Flash Attention 유틸리티에서 발생한 성능 저하 문제를 .item() 호출을 통해 해결한 사례 분석#HuggingFace#Transformers#FlashAttention#PerformanceOptimization#PyTorch2026년 7월 10일댓글 수 로딩 중
[vllm] vLLM, DeepStream NVDEC 백엔드로 비디오 디코딩 성능 혁신: GPU 가속의 힘vLLM이 DeepStream NVDEC 백엔드를 도입하여 비디오 디코딩 성능을 획기적으로 개선했습니다.#vLLM#DeepStream#GPU Optimization#Video Decoding#NVDEC#Performance#Multimodal AI2026년 7월 10일댓글 수 로딩 중
[flashinfer] FlashInfer 분산 오토튜닝 동기화: NCCL 데드락 해결을 위한 전략적 접근분산 환경에서 오토튜닝 시 발생하는 GPU 타이밍 오차로 인한 NCCL 데드락 문제를 ProcessGroup 동기화로 해결합니다.#FlashInfer#Distributed Computing#NCCL#AutoTuning#LLM2026년 7월 10일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: FlashAttentionDecodeQKV 성능 최적화 분석WebGPU EP에서 FlashAttentionDecodeQKV의 Workgroup 크기와 타일링 전략을 최적화하여 토큰 생성 속도를 약 10% 향상시킨 사례를 분석합니다.#ONNXRuntime#WebGPU#FlashAttention#PerformanceOptimization#LLM2026년 7월 9일댓글 수 로딩 중
[transformers] Hugging Face Transformers: Apple Silicon(MPS) 환경의 메모리 누수 해결을 위한 MPS Graph Cache 최적화Apple Silicon 환경에서 가변 길이 입력으로 인한 MPS Graph Cache 메모리 비대칭 증가 문제를 torch_empty_cache_steps를 통해 해결합니다.#HuggingFace#Transformers#MPS#AppleSilicon#MemoryOptimization2026년 7월 9일댓글 수 로딩 중
[loki] Grafana Loki LogQL 최적화: `max_query_series` 한도 내에서 효율적인 시리즈 누적Loki LogQL 쿼리 엔진에서 `max_query_series` 한도를 효율적으로 적용하여 메모리 사용량을 최적화하는 방법.#Grafana Loki#LogQL#성능 최적화#Go#메모리 관리#Software Engineering2026년 7월 9일댓글 수 로딩 중
[axolotl] Axolotl, NVFP4 LoRA 지원으로 MoE 모델 훈련 최적화Axolotl이 NVFP4 MoE LoRA 지원을 추가하여 MoE 모델 훈련 효율성을 높였습니다.#Axolotl#MoE#LoRA#NVFP4#최적화#딥러닝2026년 7월 9일댓글 수 로딩 중
[sglang] SGLang, 대규모 언어 모델 디버깅 속도 향상을 위한 스마트한 텐서 비교 최적화SGLang의 새로운 PR은 대규모 언어 모델 디버깅 시 발생하는 텐서 비교 비용을 획기적으로 줄여줍니다.#SGLang#성능 최적화#LLM 디버깅#텐서 비교#코드 분석2026년 7월 9일댓글 수 로딩 중
[onnxruntime] ONNX Runtime WebGPU: Intel Xe-3LPG를 위한 고성능 GEMM 최적화 분석Intel Xe-3LPG 아키텍처에서 vec4 로드와 B 타일 더블 버퍼링을 통해 GEMM 성능을 평균 12.7% 향상시킨 최적화 기법을 분석합니다.#WebGPU#ONNX Runtime#GEMM#GPU Optimization#Intel Xe-3LPG2026년 7월 8일댓글 수 로딩 중
[flashinfer] FlashInfer, 초저병렬성 환경에서의 CP 델타 규칙 사전 계산 최적화FlashInfer가 초저병렬성 환경에서 CP 델타 규칙 사전 계산 성능을 개선했습니다.#FlashInfer#LLM#최적화#GPU#CUDA2026년 7월 8일댓글 수 로딩 중
[flashinfer] FlashInfer의 BF16 GEMM 성능 극대화: CUDA Graph와 Cold L2 Cache 도입FlashInfer의 SM100 타겟 BF16 GEMM 연산에 CUDA Graph와 Cold L2 Cache를 적용하여 오버헤드를 줄이고 성능 안정성을 확보한 사례를 분석합니다.#FlashInfer#CUDA#GEMM#PerformanceOptimization#GPU2026년 7월 8일댓글 수 로딩 중
[sglang] SGLang MoE Shared Expert 최적화: 3개 커널을 1개로 융합하여 GPU 오버헤드 제거SGLang에서 MoE Shared Expert 처리 시 3개의 GPU 커널을 1개로 융합하여 성능을 개선했습니다.#SGLang#MoE#Kernel Fusion#Triton#GPU Optimization#AMD AITER2026년 7월 8일댓글 수 로딩 중
[vllm] vLLM, Diffusion-Gemma 샘플러 메모리 최적화: 요청 기반 타일링으로 OOM 문제 해결vLLM에서 Diffusion-Gemma 모델의 샘플링 과정 중 발생하는 메모리 OOM 문제를 요청 기반 타일링으로 해결한 PR을 분석합니다.#vLLM#Diffusion-Gemma#최적화#메모리 관리#LLM 추론2026년 7월 7일댓글 수 로딩 중
[uv] uv-pep440: 일반적인 버전 문자열 파싱 2배 가속화 최적화 분석uv-pep440 크레이트에서 `x.y.z` 형태의 버전 문자열 파싱을 최적화하여 성능을 2배 향상시킨 PR 분석.#Rust#uv#pep440#optimization#performance#parsing#software-engineering2026년 7월 7일댓글 수 로딩 중
[uv] uv의 휠 태그 호환성 검사 최적화: 불필요한 메모리 할당 제거하기uv의 휠 태그 호환성 검사 과정에서 발생하는 불필요한 Vec 할당을 제거하여 성능을 최대 5.6배 개선한 사례를 분석합니다.#Rust#uv#Performance#Optimization#Packaging2026년 7월 7일댓글 수 로딩 중
[triton] Triton: Blackwell 아키텍처를 위한 TMEM Load-Reduce 연산 퓨전 최적화Blackwell sm103+ GPU에서 TMEM Load와 Row Reduction을 단일 PTX 명령어로 퓨전하여 성능을 개선했습니다.#Triton#Blackwell#GPU#Optimization#Compiler2026년 7월 7일댓글 수 로딩 중
[vllm] [vLLM 성능 최적화] Kimi-K2.5/K2.6 이미지 전처리 10배 가속화: Numba와 퓨전 기법 활용vLLM에서 Kimi-K2.5/K2.6 모델의 이미지 전처리를 Numba와 룩업 테이블로 최대 10배 최적화한 사례를 분석합니다.#vLLM#성능 최적화#Numba#이미지 전처리#Kimi-K2.5#Python#Deep Learning2026년 7월 6일댓글 수 로딩 중
[sglang] sglang, 멀티모달 모델 인코더 병렬 처리 최적화: 전체 복제본 활용으로 성능 향상sglang PR 분석: 멀티모달 모델의 텍스트/이미지 인코더 병렬 처리 방식을 개선하여 전체 GPU 복제본을 활용하고 성능을 극대화합니다.#sglang#병렬 처리#최적화#멀티모달#딥러닝2026년 7월 6일댓글 수 로딩 중
[vllm] vLLM 성능 최적화: token_to_req_indices 캐싱을 통한 6배 성능 향상vLLM에서 중복되던 CPU-GPU 간 데이터 복사를 제거하여 커널 성능을 5~6배 개선한 최적화 사례를 분석합니다.#vLLM#LLM#Performance#Optimization#CUDA2026년 7월 6일댓글 수 로딩 중
[vllm] vLLM Transformers Modeling Backend 성능 최적화: 네이티브 수준의 속도 달성Transformers 모델링 백엔드에 Fused Linear와 MoE 최적화를 도입하여 vLLM 네이티브 수준의 성능을 구현한 기술적 분석.#vLLM#LLM#Optimization#Transformers#PyTorch2026년 7월 6일댓글 수 로딩 중