[Liger-Kernel] Liger-Kernel: Cross-Entropy와 Total Variation Distance를 하나로 융합하여 성능을 극대화하다Liger-Kernel이 Cross-Entropy와 Total Variation Distance를 단일 연산으로 융합하여 메모리 및 HBM 트래픽을 획기적으로 개선했습니다.#딥러닝#최적화#Triton#GPU#Liger-Kernel2026년 9월 27일댓글 수 로딩 중
[flashinfer] FlashInfer, MiniMax-H3 어텐션 최적화: BF16 및 NVFP4 지원으로 성능 혁신FlashInfer의 MiniMax-H3 어텐션 최적화 PR 분석: BF16 및 NVFP4 지원으로 성능 향상 및 새로운 가능성 제시#FlashInfer#AI#딥러닝#최적화#GPU#어텐션 메커니즘#BF16#NVFP42026년 9월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 plan() 함수 최적화: Python max()에서 Tensor.max()로의 전환FlashInfer의 plan() 함수에서 Python max()를 Tensor.max()로 대체하여 호스트 시간 성능을 크게 향상시킨 PR 분석#FlashInfer#최적화#성능#딥러닝#LLM2026년 9월 22일댓글 수 로딩 중
[ultralytics] SAM3 텍스트 프롬프팅 VRAM 최적화: 청크 기반 처리로 메모리 사용량 대폭 감소SAM3의 텍스트 프롬프팅 시 VRAM 사용량을 획기적으로 줄이는 청크 기반 처리 기법을 소개합니다.#ultralytics#SAM3#VRAM 최적화#딥러닝#컴퓨터 비전2026년 9월 22일댓글 수 로딩 중
[flashinfer] FlashInfer, 최신 GPU 아키텍처를 위한 커널 튜닝으로 성능 극대화FlashInfer가 최신 GPU 아키텍처(SM100/103/107)에 맞춰 커널 튜닝을 통해 qk_rmsnorm 및 fused_add_rmsnorm_quant 성능을 개선했습니다.#GPU#최적화#성능#CUDA#FlashInfer#딥러닝2026년 9월 18일댓글 수 로딩 중
[sglang] NVLink를 활용한 sglang의 DSpark 헤드 최적화: 더 빠른 토큰 생성sglang의 DSpark 헤드에서 NVLink 집단 통신을 활용하여 토큰 생성 속도를 개선하는 방법을 분석합니다.#sglang#NVLink#DSpark#최적화#성능#딥러닝2026년 9월 14일댓글 수 로딩 중
[vllm] vLLM, ROCm 환경에서 FP8 GEMM 최적화로 성능 4-9% 향상vLLM이 ROCm 환경에서 FP8 GEMM 연산에 'bpreshuffled' 기법을 도입하여 성능을 4-9% 향상시킨 PR 분석#vLLM#ROCm#FP8#GEMM#성능 최적화#딥러닝2026년 9월 10일댓글 수 로딩 중
[flashinfer] FlashInfer SM12x MoE 최적화: 정적 MoE 경로 통합 및 성능 향상FlashInfer의 SM12x 아키텍처에서 정적 MoE 경로를 최적화하고 통합하여 성능을 크게 향상시킨 PR 분석#FlashInfer#MoE#최적화#성능#CUDA#딥러닝2026년 8월 31일댓글 수 로딩 중
[flashinfer] NVIDIA Blackwell 아키텍처를 위한 FlashInfer의 Router GEMM 최적화FlashInfer가 NVIDIA Blackwell GPU에서 Router GEMM 연산 성능을 1.1x 이상 향상시킨 최적화 PR 분석#NVIDIA Blackwell#Router GEMM#FlashInfer#GPU 최적화#성능 향상#딥러닝2026년 8월 20일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V3.2 커널의 대규모 토큰 처리 안정성 강화vLLM의 DeepSeek V3.2 커널에서 발생하던 대규모 단일 반복 토큰 처리 오류를 해결하여 안정성을 높였습니다.#vLLM#Triton#CUDA#최적화#딥러닝2026년 8월 18일댓글 수 로딩 중
[sglang] Sana 모델의 BCG 성능 향상: 비트-정확 Triton 커널을 활용한 컨볼루션 후처리 최적화Sana 모델의 BCG 후처리에서 컨볼루션 연산을 비트-정확 Triton 커널로 융합하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#Triton#Diffusion Models#Sana2026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V4 사전 생성 처리량 향상을 위한 Sparse Top-K 메타데이터 커널 최적화vLLM의 DeepSeek-V4 모델에서 사전 생성 처리량을 높이기 위해 Sparse Top-K 메타데이터 커널을 최적화했습니다.#vLLM#성능 최적화#딥러닝#LLM#DeepSeek-V42026년 8월 16일댓글 수 로딩 중
[vllm] vLLM, DeepSeek-V3.2/GLM-5.2 MTP 경로 최적화: All-Reduce 융합 및 로컬 Argmax 도입vLLM에서 DeepSeek-V3.2/GLM-5.2 모델의 MTP 경로 성능을 향상시키는 두 가지 최적화 기법을 소개합니다.#vLLM#성능 최적화#딥러닝#LLM#MTP#DeepSeek#GLM2026년 8월 15일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 MoE GEMM 최적화: 웨이브+잔여물 비용 모델 도입FlashInfer의 SM120 MoE GEMM 성능을 향상시키는 웨이브+잔여물 비용 모델 도입 및 타일 선택 개선.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#GEMM#FP8#SM1202026년 8월 12일댓글 수 로딩 중
[sglang] ERNIE-Image 모델의 성능 향상: 비트-정확성(Bit-Exact)을 유지한 RMSNorm+Scale/Shift 융합 커널 도입ERNIE-Image 모델에서 RMSNorm과 Scale/Shift 연산을 융합하여 성능을 개선하고, 비트-정확성을 완벽하게 보장하는 Triton 커널을 소개합니다.#Triton#ERNIE-Image#성능 최적화#딥러닝#LLM2026년 8월 6일댓글 수 로딩 중
[flashinfer] FlashInfer, MoE 모델의 성능을 극적으로 향상시키는 융합 커널과 최적화된 스케줄러 도입FlashInfer가 MoE 모델의 FC1 연산을 융합 커널로 최적화하고, 워프 협력 스케줄러를 도입하여 성능을 크게 향상시켰습니다.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#FP8#MXFP8#CUDA2026년 7월 29일댓글 수 로딩 중
[axolotl] Axolotl, NVFP4 LoRA 지원으로 MoE 모델 훈련 최적화Axolotl이 NVFP4 MoE LoRA 지원을 추가하여 MoE 모델 훈련 효율성을 높였습니다.#Axolotl#MoE#LoRA#NVFP4#최적화#딥러닝2026년 7월 9일댓글 수 로딩 중
[sglang] sglang, 멀티모달 모델 인코더 병렬 처리 최적화: 전체 복제본 활용으로 성능 향상sglang PR 분석: 멀티모달 모델의 텍스트/이미지 인코더 병렬 처리 방식을 개선하여 전체 GPU 복제본을 활용하고 성능을 극대화합니다.#sglang#병렬 처리#최적화#멀티모달#딥러닝2026년 7월 6일댓글 수 로딩 중
[axolotl] Axolotl MoE 모델 최적화: Tiled-MLP 도입 및 FSDP2 통합으로 성능 극대화Axolotl에서 MoE 모델의 성능을 획기적으로 개선한 Tiled-MLP 도입 및 FSDP2 최적화 분석#Axolotl#MoE#Tiled-MLP#FSDP2#최적화#성능 개선#딥러닝2026년 5월 28일댓글 수 로딩 중
[sglang] SGLang, 레이어별 오프로딩 기본값 설정을 통한 인코더/VAE 성능 최적화SGLang에서 레이어별 오프로딩을 기본값으로 설정하여 인코더 및 VAE 컴포넌트의 추론 속도를 개선했습니다.#SGLang#성능 최적화#딥러닝#컴퓨터 비전#LLM2026년 5월 17일댓글 수 로딩 중
[sglang] DeepseekV4 모델의 입력 레이어 정규화와 FP8 양자화를 융합하여 성능 최적화DeepseekV4 모델의 입력 레이어 정규화와 FP8 양자화를 융합하여 GPU 연산 효율성을 높였습니다.#AI#딥러닝#최적화#FP8#GPU2026년 5월 12일댓글 수 로딩 중
[sglang] NPU 성능 향상을 위한 causal_conv1d_update_v2 도입NPU 환경에서 causal_conv1d_update_v2를 사용하여 모델 추론 속도를 크게 개선했습니다.#NPU#성능 최적화#딥러닝#LLM#SGLang2026년 5월 12일댓글 수 로딩 중
[flashinfer] FlashInfer, FP8 지원으로 장문 컨텍스트 추론 성능을 극적으로 향상시키다FlashInfer의 concat_mla_k 함수에 FP8 지원을 추가하여 장문 컨텍스트 추론 성능을 크게 개선했습니다.#FlashInfer#FP8#LLM#최적화#성능 향상#딥러닝2026년 5월 7일댓글 수 로딩 중
[sglang] HunyuanVideo VAE 디코딩 성능 향상: GroupNorm SiLU 커널 최적화HunyuanVideo VAE 디코딩 시 GroupNorm SiLU 연산의 성능을 극적으로 개선한 Triton 커널 최적화 분석#AI#딥러닝#최적화#Triton#HunyuanVideo#VAE2026년 5월 2일댓글 수 로딩 중
[vllm] vLLM, DCP A2A 어텐션 백엔드 최적화: 단일 All-to-All 콜렉티브로 성능 향상vLLM의 DCP A2A 어텐션 백엔드가 부분 어텐션 출력과 LSE를 단일 콜렉티브로 묶어 성능을 개선했습니다.#vLLM#AI#딥러닝#최적화#LLM#어텐션#DCP#All-to-All2026년 5월 1일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL 기반 FMHA 커널 통합으로 사전 생성(Prefill) 성능 극대화FlashInfer가 CuTe DSL FMHA 커널을 통합하여 사전 생성(Prefill) 성능을 최적화했습니다.#FlashInfer#CuTe DSL#FMHA#Prefill#최적화#성능 개선#딥러닝#LLM2026년 4월 24일댓글 수 로딩 중