[sglang] SGLang: LFM2-MoE 모델을 위한 SM90 커널 퓨전 최적화 분석LFM2-MoE의 short-convolution 경로를 Triton 커널로 퓨전하여 연산 병목을 3배 가까이 개선한 사례를 분석합니다.#SGLang#Triton#CUDA#Optimization#LLM2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell 시대를 위한 최적화: FlashInfer의 SM120 Block-Sparse Attention 백엔드 도입기NVIDIA Blackwell(SM120) 아키텍처를 위한 Cake 백엔드 기반 Block-Sparse Attention 최적화로 성능을 11% 향상시킨 사례를 분석합니다.#FlashInfer#CUDA#Blackwell#SM120#Attention#Performance-Optimization2026년 9월 5일댓글 수 로딩 중
[flashinfer] Blackwell GPU를 위한 고성능 Recurrent-KDA 커널 최적화 및 통합Blackwell GPU 아키텍처에 최적화된 104개 KDA 커널 포트폴리오를 통합하여 추론 성능을 극대화했습니다.#FlashInfer#CUDA#Blackwell#KernelOptimization#LLM2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang, JoyEcho 모델에 Breakable CUDA Graph 적용하여 추론 속도 43% 향상SGLang에서 JoyEcho 모델의 추론 병목 현상을 해결하고 속도를 획기적으로 개선한 Breakable CUDA Graph 적용 사례를 분석합니다.#SGLang#CUDA Graph#최적화#성능 향상#JoyEcho#AI 모델2026년 9월 5일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: RTX 5090 32GB 환경에서의 CUDA Graph 및 Chunked Prefill 개선RTX 5090 등 32GB GPU 환경에서 CUDA Graph max_bs를 상향하여 고부하 상황의 디코딩 성능 저하를 해결한 사례를 분석합니다.#SGLang#LLM#CUDA#Performance#RTX50902026년 9월 4일댓글 수 로딩 중
[flashinfer] [FlashInfer] Blackwell 아키텍처를 위한 Warp Level Split-K BF16 GEMM 최적화 분석Blackwell(SM100/103) 환경에서 저지연 Decode GEMM 성능을 극대화하기 위한 Warp Split-K 기법과 Autotuner 개선 사항을 살펴봅니다.#CUDA#GEMM#Blackwell#FlashInfer#Performance-Optimization#vLLM2026년 9월 4일댓글 수 로딩 중
[transformers] Hugging Face Transformers, GGUF 추론 속도 향상을 위한 대대적인 리팩토링Hugging Face Transformers 라이브러리가 GGUF 모델 추론 속도 향상을 위해 대대적인 리팩토링을 진행했습니다.#transformers#GGUF#inference#optimization#quantization#llama.cpp#kernels2026년 9월 4일댓글 수 로딩 중
[vllm] vLLM의 Fast Start: CUDA IPC를 활용한 모델 가중치 제로 카피 로딩모델 가중치를 GPU 메모리에 상주시키는 데몬을 통해 엔진 재시작 시 디스크 I/O 없이 즉시 로딩하는 최적화 기법을 소개합니다.#vLLM#CUDA#IPC#Optimization#LLM2026년 9월 4일댓글 수 로딩 중
[sglang] MiniMax-H3 모델의 AdaLN 추론 최적화: Pinned-Host 캐싱과 LRU 전략MiniMax-H3 모델의 AdaLN 재구축 비용을 획기적으로 줄이는 Pinned-Host 캐싱 및 LRU 기법 도입#SGLang#Diffusion#Optimization#Caching#MiniMax-H32026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 PLE 메타데이터 전송 최적화: 비동기 전송으로 성능 향상vLLM의 Qwen4Exp PLE 메타데이터 빌더에서 비동기 전송을 사용하여 GPU 커널 간 동기화를 제거하고 성능을 향상시킨 PR 분석.#vLLM#최적화#성능#LLM#GPU#CUDA2026년 9월 3일댓글 수 로딩 중
[vllm] vLLM의 작은 배치 사이즈를 위한 Triton 기반 Split-row Top-p 샘플링 최적화작은 배치 환경에서 vLLM의 Top-p 샘플링 성능을 극대화하기 위해 Triton 커널을 재설계하여 효율성을 높였습니다.#vLLM#Triton#CUDA#LLM#Performance2026년 9월 3일댓글 수 로딩 중
[flashinfer] FlashInfer, CuTe DSL을 활용한 저지연 GEMM 커널 도입으로 성능 극대화FlashInfer가 CuTe DSL 기반의 저지연 GEMM 커널을 도입하여 FP4/FP8 연산 성능을 혁신적으로 개선했습니다.#FlashInfer#GEMM#CuTe DSL#FP8#FP4#최적화#성능2026년 9월 3일댓글 수 로딩 중
[논문리뷰] WorldReward: Reward Modeling for Camera-Conditioned World Models본 논문은 camera-conditioned world models의 생성물에 대해 Action-consistency와 Visual-quality를 동시에 평가하는 신뢰할 수 있는 Reward 모델의 부재를 해결합니다.#Review#World Models#Reward Modeling#Camera-Conditioned#Vision-Language Models#Preference Optimization#Reinforcement Learning2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM본 논문은 Gated DeltaNet (GDN)과 같은 선형 Attention 레이어를 포함하는 Hybrid Large Language Models (LLMs)에 NVFP4 W4A4 4-bit 양자화를 적용하는 과정에서의 근본적인 문제를 다룬다.#Review#NVFP4#W4A4#Gated DeltaNet#LLM Quantization#Hybrid LLM#Recurrent Networks#KV-cache#Post-training Quantization2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Using Grounded Theory for Agent Behavior Analysis at Scale본 논문은 LLM 기반 에이전트의 복잡한 행동 궤적을 이해하고, 성공과 실패의 원인을 규모 있게(at scale) 분석하는 방법론의 부재를 해결합니다. 기존의 정량적 메타데이터(수행 성공 여부 등)는 에이전트가 '왜' 실패했는지에 대한 설명력이 부족하며, 수동 분석은 확장성이 매우 낮습니다 .#Review#Agent Behavior Analysis#Grounded Theory#Multi-Agent Framework#Qualitative Coding#Theoretical Saturation#Failure Prediction2026년 9월 3일댓글 수 로딩 중
[논문리뷰] The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation본 연구는 script-driven audio-video generation에서 스크립트 내 촬영 전환 및 대사 시점이 영상 생성 결과물에 정밀하게 반영되지 않는 문제를 해결하고자 합니다.#Review#Script-driven Generation#Audio-Video Generation#Temporal Context Routing#Temporal Alignment#Diffusion Transformers#Cross-Attention2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments본 논문은 terminal-based agent의 학습에 필수적인 고품질의 실행 환경(Executable Environment)이 부족하다는 문제점을 해결하고자 합니다.#Review#Terminal-based Agent#Trajectory Reconstruction#Executable Environment#Supervised Fine-tuning#Multi-round Interaction#Cross-workspace Synthesis2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs본 논문은 기존의 Long-Video MLLM 연구들이 frame selection, compression, reinvestment 과정을 개별적으로 분리하지 않고 시스템 단위로 평가하여, 각 단계의 실제 기여도를 명확히 파악하기 어렵다는 문제를 해결하고자 합니다.#Review#Long-Video MLLMs#Visual-Token Allocation#Orthogonal Matching Pursuit#Frame Selection#Spatial Compression#Token Reinvestment2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction본 논문은 기존 Online 3D reconstruction 모델들이 장기 영상(Long video) 처리 시 발생하는 기하학적 붕괴 문제를 해결하고자 합니다 .#Review#Online 3D reconstruction#Relative pose estimation#Prompt tuning#Pose graph optimization#Asymmetric attention2026년 9월 3일댓글 수 로딩 중
[논문리뷰] Rethinking On-Policy Distillation of Large Language Models II: One Training Example본 논문은 LLM의 후처리(post-training) 과정에서 널리 활용되는 On-policy Distillation (OPD) 방법론에서 훈련 데이터(training data)의 역할이 불분명하다는 핵심 문제를 제기합니다.#Review#On-policy Distillation (OPD)#Large Language Models (LLMs)#State Coverage#Absorption Rate#Data Efficiency#One-shot Learning#Multi-teacher OPD (MOPD)2026년 9월 3일댓글 수 로딩 중