[sglang] SGLang의 Marlin MoE 커널 최적화: JIT 컴파일 시간 특화와 점유율 기반 스케줄링Marlin MoE 커널의 분기 제거 및 점유율 최적화를 통해 Kimi-K2.7 모델의 Prefill 성능을 약 4% 향상시킨 사례 분석#SGLang#CUDA#Marlin#MoE#Performance2026년 7월 25일댓글 수 로딩 중
[vllm] vLLM, 캐싱 비활성화 시 불필요한 LRU 해시 분할 제거로 디코드 처리량 3.5% 향상vLLM에서 캐싱 비활성화 시 불필요한 LRU 해시 분할 로직을 제거하여 디코드 처리량을 개선한 PR 분석.#vLLM#성능 최적화#LLM#GPU 캐싱#LRU2026년 7월 25일댓글 수 로딩 중
[triton] Triton Blackwell 커널의 MXFP8 활성화 스케일 최적화: Zero Padding 전략Blackwell 아키텍처에서 MXFP8 활성화 스케일 저장 시 발생하는 성능 저하를 Producer 측의 Zero Padding으로 해결한 사례 분석.#Triton#Blackwell#MXFP8#KernelOptimization#GPU2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer의 FP8 양자화 AllReduce를 통한 통신 대역폭 최적화FP8 양자화를 통해 AllReduce 통신량을 절반으로 줄여 대규모 모델 학습의 NVLink 병목을 해결합니다.#FlashInfer#AllReduce#FP8#Quantization#NVLink#Triton2026년 7월 24일댓글 수 로딩 중
[vllm] vLLM, Blackwell 아키텍처를 위한 디코드 성능 최적화: GLM-5.2 및 DeepSeek-V3.2 지원 강화vLLM이 Blackwell GPU에서 GLM-5.2 및 DeepSeek-V3.2 모델의 디코드 성능을 대폭 향상시키는 최적화를 소개합니다.#vLLM#Blackwell#GLM-5.2#DeepSeek-V3.2#성능 최적화#GPU 컴퓨팅#LLM2026년 7월 24일댓글 수 로딩 중
[onnxruntime] ONNX Runtime: Blackwell (SM120+)에서 NVFP4 QMoE를 위한 네이티브 FP4xFP4 Prefill 최적화ONNX Runtime이 Blackwell GPU에서 NVFP4 QMoE의 FP4xFP4 prefill 경로를 최적화하고, SM120 빌드 오류를 해결한 PR 분석.#ONNXRuntime#CUDA#FP4#Quantization#Blackwell#SM120#CUTLASS#Optimization#MoE2026년 7월 24일댓글 수 로딩 중
[onnxruntime] [ONNX Runtime] CPU GQA 성능의 한계를 넘다: FP16 입력과 양자화된 KV 캐시 최적화 분석FP16 활성화 함수와 INT8/INT4 KV 캐시를 결합하여 CPU 추론 성능을 극대화한 ONNX Runtime의 최신 GQA 최적화 기법을 살펴봅니다.#ONNX Runtime#LLM Optimization#CPU Inference#SIMD#C++2026년 7월 24일댓글 수 로딩 중
[flashinfer] FlashInfer SM103 FP4 GEMM 최적화: Store256 및 Fused Epilogue 도입SM103 아키텍처에서 256-bit 정렬 스토어와 Fused F32x2 연산을 통해 FP4 GEMM 성능을 최대 16% 향상시킨 기술적 분석.#FlashInfer#CUDA#GEMM#SM103#Optimization#CUTLASS2026년 7월 23일댓글 수 로딩 중
[sglang] SGLang Mamba 캐시의 상태 손상 및 슬롯 누수 버그 수정SGLang Mamba 캐시에서 발생하던 요청 상태 손상 및 슬롯 누수 버그를 수정하여 안정성을 높였습니다.#SGLang#Mamba#Cache#Bug Fix#Optimization#LLM2026년 7월 23일댓글 수 로딩 중
[vllm] vLLM Inkling 모델: 인플레이스 연산으로 GPU 메모리 최적화 및 OOM 방지vLLM Inkling 모델에서 불필요한 임시 텐서 할당을 제거하여 GPU 메모리 사용량을 최적화하고 OOM을 방지하는 기술적 개선.#vLLM#PyTorch#GPU Optimization#Memory Management#Inkling Model#OOM Prevention#In-place Operations2026년 7월 23일댓글 수 로딩 중
[vllm] vLLM의 KV 캐시 로드 경로 최적화: NumPy를 활용한 VectorizationvLLM의 KV 캐시 로드 경로에서 발생하는 병목 현상을 NumPy를 이용해 개선한 PR 분석#vLLM#성능 최적화#KV 캐시#Vectorization#NumPy#Python2026년 7월 23일댓글 수 로딩 중
[llm-compressor] vLLM LLM-Compressor: CUDA OOM 문제 해결을 위한 메모리 핀닝 최적화CUDA OOM을 유발하던 무분별한 메모리 핀닝을 지연 핀닝 방식으로 변경하여 대규모 모델의 AWQ 최적화 안정성을 확보했습니다.#vLLM#LLM-Compressor#CUDA#Memory Management#AWQ#Optimization2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Visual Contrastive Self-Distillation기존의 OPSD는 Teacher와 Student 간의 정보 비대칭성(Asymmetry)을 확보하기 위해 privileged answer, Reasoning trace, 또는 시각적 증거(Visual evidence)와 같은 추가적인 외부 정보에 의존해왔습니다.#Review#On-policy Self-distillation#Vision-Language Models#Visual Grounding#Contrastive Decoding#Knowledge Distillation#Input Conditioning2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction본 논문은 기존 코딩 에이전트 벤치마크들이 직면한 데이터 오염(Contamination)과 평가의 편향성 문제를 해결하고자 합니다. SWE-bench와 같은 기존 공개 벤치마크는 문제와 해결책이 온라인에 공개되어 있어 에이전트가 이를 기억하여 점수를 높이는 Memorization 문제가 발생합니다.#Review#Coding Agent#Benchmark#Contamination-Resistance#Software Engineering#Web Development#Office Workflow#Security Analysis2026년 7월 23일댓글 수 로딩 중
[논문리뷰] TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation본 논문은 일반화 가능한 로봇 조작 정책 학습에 필수적인 대규모 고충실도 시뮬레이션 데이터의 부족 문제를 해결하고자 한다. 기존의 자동화된 시뮬레이션 생성 방식은 텍스트 기반의 단순화된 배치나 가상 데이터에 의존하여 실제 인간 환경의 복잡한 클러터(clutter)와 빽빽한 배치를 재현하지 못하는 한계가 있다.#Review#Real2Sim#Manipulation#Scene Generation#Trajectory Generation#Robotic Manipulation2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers본 논문은 다중 에이전트 환경에서 기존 비디오 확산 모델(Video Diffusion Model)이 겪는 논리적 및 기하학적 일관성 부족 문제를 해결합니다. 기존 모델들은 파편화된 에이전트별 관측치만을 조건부 컨텍스트로 사용하므로, 에이전트 간 공유되는 세계 상태를 유지하는 데 한계가 있습니다 .#Review#World Models#Multi-Agent Generation#Video Diffusion#World State Registers#Mixture-of-Transformers#Autoregressive Modeling2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text본 논문은 기존 공간 인지 벤치마크가 텍스트 출력 VLM에 편향되어 있어, 이미지 생성 모델의 공간적 능력을 객관적으로 평가할 수 없는 인터페이스 불일치 문제를 해결하고자 한다 .#Review#Spatial Cognition#Generative Pixels#ProVisE#SpatialGen-Bench#VLM#Answer-Interface Mismatch#Benchmark-Agnostic Framework2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Self-Supervised Learning of Structured Dynamics from Videos본 논문은 비디오 내에서 얽혀 있는 카메라 모션과 객체 모션을 분리하여 구조화된 동역학 표현을 학습하는 것을 목표로 합니다.#Review#Self-Supervised Learning#Structured Dynamics#Video Representation#Future-Feature Prediction#Camera Motion#Object Motion2026년 7월 23일댓글 수 로딩 중
[논문리뷰] Sample-Efficient Learning from Agent Experience본 연구는 실제 환경과의 상호작용이 매우 비용이 많이 드는 상황에서 에이전트가 경험으로부터 효율적으로 학습하지 못하는 문제를 해결하고자 한다. ICL은 샘플 효율적인 학습을 제공하지만, 문맥이 제거되면 학습된 지식이 유지되지 않는 휘발성을 가진다.#Review#Experience Distillation#In-context Learning#Sample Efficiency#Agent Learning#Knowledge Distillation#Interactive Agent Tasks2026년 7월 23일댓글 수 로딩 중
[논문리뷰] SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation본 논문은 기존의 고해상도 Video DiT 모델들이 사용하는 Full-Softmax Attention의 O(N²) 계산 복잡도로 인해 발생하는 심각한 Latency 및 연산 비용 문제를 해결하고자 한다.#Review#Video Generation#Diffusion Transformer#Hybrid Linear Attention#Attention Residuals#Flow Matching#Efficient Inference#Scaling Law2026년 7월 23일댓글 수 로딩 중