[triton] Triton FP4 레이아웃 변환 최적화: 불필요한 메모리 할당 및 복사 제거Triton 라이브러리에서 FP4 데이터 타입의 레이아웃 변환 시 발생하는 비효율성을 제거하여 메모리 사용량과 실행 시간을 개선합니다.#Triton#FP4#최적화#메모리 관리#성능 개선2026년 8월 28일댓글 수 로딩 중
[vllm] vLLM, Pixtral 모델의 멀티모달 인코더 어텐션 최적화: Packed Sequence Metadata 도입vLLM이 Pixtral 모델에서 멀티모달 인코더 어텐션의 성능과 메모리 효율성을 개선합니다.#vLLM#Pixtral#멀티모달#어텐션#최적화#성능 개선2026년 8월 26일댓글 수 로딩 중
[flashinfer] FlashInfer GDN 커널의 SM90/SM120 비-CP 런치 오버헤드 감소 최적화 분석FlashInfer GDN 커널에서 SM90/SM120 GPU의 비-CP 런치 오버헤드를 줄여 성능을 개선한 PR 분석입니다.#FlashInfer#GDN#최적화#성능 개선#CUDA#TVM2026년 8월 24일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell 아키텍처를 위한 Recurrent KDA Prefill 최적화: Small-BH 커널 도입FlashInfer가 Blackwell GPU에서 Recurrent KDA Prefill 성능을 획기적으로 개선하는 Small-BH 커널을 도입했습니다.#FlashInfer#NVIDIA Blackwell#GPU 최적화#CUDA#LLM#성능 개선2026년 8월 19일댓글 수 로딩 중
[sglang] sglang, MoE 모델 로딩 속도 5.6배 향상: mmap 뷰 최적화 분석sglang에서 MoE 모델 로딩 시 발생하는 병목 현상을 해결하여 로딩 속도를 획기적으로 개선한 PR을 분석합니다.#sglang#MoE#최적화#성능 개선#모델 로딩#AMD GPU2026년 8월 2일댓글 수 로딩 중
[vllm] vLLM DeepSeek V4 모델의 불필요한 메모리 할당 및 복사 최적화 분석vLLM DeepSeek V4 모델에서 MTP 미사용 시 불필요한 메모리 할당 및 복사를 제거하여 성능을 개선한 PR 분석#vLLM#DeepSeek V4#최적화#메모리 관리#성능 개선2026년 7월 30일댓글 수 로딩 중
[sglang] SM120 Blackwell에서 DeepSeek-V4 모델 서빙 최적화: FlashInfer MXFP4 MoE 도입 및 메모리 절감SM120 GPU에서 DeepSeek-V4 모델 서빙 시 발생하던 문제를 해결하고 성능을 개선한 PR 분석.#sglang#DeepSeek-V4#SM120#Blackwell#FlashInfer#MXFP4#MoE#최적화#성능 개선#메모리 절감2026년 7월 18일댓글 수 로딩 중
[sglang] SGLang, MoonViT의 최대 시퀀스 길이 메타데이터 재사용으로 성능 개선SGLang의 MoonViT 구현에서 최대 시퀀스 길이 계산 시 GPU-호스트 동기화를 제거하여 성능을 향상시켰습니다.#SGLang#최적화#성능 개선#MoonViT#FlashAttention2026년 7월 12일댓글 수 로딩 중
[onnxruntime] WebGPU FlashAttention 최적화: 커널 퓨전과 가변 시퀀스 길이 지원으로 성능 극대화WebGPU FlashAttention의 커널 퓨전과 가변 시퀀스 길이 지원을 통한 성능 개선 분석#WebGPU#FlashAttention#ONNX Runtime#최적화#성능 개선#AI 가속2026년 6월 11일댓글 수 로딩 중
[sglang] 실시간 RGB 전송 속도 향상을 위한 최적화 분석sglang의 실시간 RGB 전송에서 불필요한 압축을 제거하여 성능을 22.4% 향상시킨 PR 분석#sglang#최적화#성능 개선#실시간 전송#RGB#Gzip2026년 6월 4일댓글 수 로딩 중
[axolotl] Axolotl MoE 모델 최적화: Tiled-MLP 도입 및 FSDP2 통합으로 성능 극대화Axolotl에서 MoE 모델의 성능을 획기적으로 개선한 Tiled-MLP 도입 및 FSDP2 최적화 분석#Axolotl#MoE#Tiled-MLP#FSDP2#최적화#성능 개선#딥러닝2026년 5월 28일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL 기반 FMHA 커널 통합으로 사전 생성(Prefill) 성능 극대화FlashInfer가 CuTe DSL FMHA 커널을 통합하여 사전 생성(Prefill) 성능을 최적화했습니다.#FlashInfer#CuTe DSL#FMHA#Prefill#최적화#성능 개선#딥러닝#LLM2026년 4월 24일댓글 수 로딩 중
[vllm] vLLM, Arm CPU의 BF16 GELU 연산을 LUT 기반 구현으로 8배 가속vLLM이 Arm CPU 환경에서 BF16 GELU 연산을 LUT 기반으로 구현하여 성능을 크게 향상시킨 PR 분석.#vLLM#Arm CPU#BF16#GELU#최적화#성능 개선#LUT2026년 4월 16일댓글 수 로딩 중
[vllm] vLLM Nemotron Nano VL: Pixel Shuffle 최적화를 통한 성능 향상 분석vLLM Nemotron Nano VL 모델에서 Pixel Shuffle 연산을 최적화하여 성능을 개선한 PR을 분석합니다.#vLLM#Nemotron Nano VL#Pixel Shuffle#최적화#성능 개선#PyTorch2026년 4월 10일댓글 수 로딩 중