[sglang] [Kimi K3] CPU 전송 이미지의 지연 전처리(Deferred Preprocessing)를 통한 VLM 성능 최적화Kimi-K3 모델에서 이미지 전처리를 실제 연산을 수행하는 GPU(Vision Owner)로 미루어 데이터 전송 오버헤드를 줄이고 TTFT를 최대 78% 개선한 사례를 분석합니다.#VLM#Optimization#SGLang#Kimi-K3#Distributed-Computing2026년 8월 9일댓글 수 로딩 중
[ollama] Ollama, DFlash를 통한 추론 속도 향상: 블록 단위 추론의 힘Ollama가 DFlash를 도입하여 모델 추론 시 블록 단위 토큰 생성을 통해 속도를 크게 개선했습니다.#Ollama#MLX#추론 최적화#DFlash#LLM2026년 8월 8일댓글 수 로딩 중
[sglang] SGLang 캐시 시뮬레이터의 병목 해결: 직렬 전송에서 동시성 전송으로의 최적화SGLang의 캐시 시뮬레이터 ingest tee를 직렬 방식에서 동시성(fan-out) 방식으로 개선하여 처리량 병목을 해결했습니다.#SGLang#Rust#Tokio#Performance#Concurrency2026년 8월 8일댓글 수 로딩 중
[vllm] [vLLM] CPU MoE 성능을 극대화하는 전략: 고정 임계값을 넘어선 동적 GEMM 디스패치 최적화vLLM의 CPU FP8/MXFP4 MoE 커널에서 전역 평균 기반의 GEMM 선택 로직을 제거하고, 개별 전문가 블록 단위로 BRGEMM을 동적 선택하여 최대 1.59배의 성능 향상을 달성했습니다.#vLLM#CPU Optimization#MoE#FP8#BRGEMM#Deep Learning2026년 8월 8일댓글 수 로딩 중
[cpython] CPython 최적화: functools.reduce 대신 Union 직접 사용하기typing.Union 재구성 시 functools.reduce를 제거하여 성능을 최대 35배 개선했습니다.#CPython#Python#Performance#Optimization#typing2026년 8월 7일댓글 수 로딩 중
[flashinfer] FlashInfer, Blackwell GPU를 위한 Gated MoE 커널 최적화로 성능 대폭 향상Blackwell GPU의 Gated Mixture-of-Experts(MoE) 연산 성능을 극대화하는 최적화 기법을 분석합니다.#FlashInfer#MoE#GPU 최적화#Blackwell#NVFP42026년 8월 7일댓글 수 로딩 중
[sglang] [SGLang] Diffusion 모델의 TP/FSDP 체크포인트 로딩 속도를 20% 이상 개선하는 방법모든 랭크가 전체 체크포인트를 읽던 비효율을 해결하고, 필요한 슬라이스만 선택적으로 로드하여 I/O 부하를 절반으로 줄였습니다.#SGLang#PyTorch#Distributed-Training#Checkpoint-Loading#Performance-Optimization2026년 8월 7일댓글 수 로딩 중
[sglang] SGLang LTX-2 모델을 위한 Breakable CUDA Graph 최적화 분석LTX-2 모델의 Breakable CUDA Graph 지원을 통해 H200 환경에서 추론 속도를 1.56배 향상시킨 최적화 기법을 분석합니다.#SGLang#CUDA Graph#LTX-2#Performance Optimization#LLM Serving2026년 8월 7일댓글 수 로딩 중
[sglang] [Diffusion] Qwen 모델의 Varlen Mask 메타데이터 호스트 측 빌드 최적화Qwen Diffusion 모델에서 GPU 동기화를 유발하던 Varlen Mask 메타데이터 생성을 호스트 측으로 옮겨 성능을 개선합니다.#SGLang#Diffusion#Performance Optimization#PyTorch#Varlen Attention#Qwen2026년 8월 7일댓글 수 로딩 중
[sglang] FLUX.2 모델의 추론 속도 향상: Residual-Gate 커널 최적화FLUX.2 모델의 residual-gate 연산을 전용 CUDA 커널로 통합하여 추론 속도를 약 1.2% 개선했습니다.#SGLang#FLUX.2#CUDA#Optimization#Diffusion2026년 8월 6일댓글 수 로딩 중
[sglang] ERNIE-Image 모델의 성능 향상: 비트-정확성(Bit-Exact)을 유지한 RMSNorm+Scale/Shift 융합 커널 도입ERNIE-Image 모델에서 RMSNorm과 Scale/Shift 연산을 융합하여 성능을 개선하고, 비트-정확성을 완벽하게 보장하는 Triton 커널을 소개합니다.#Triton#ERNIE-Image#성능 최적화#딥러닝#LLM2026년 8월 6일댓글 수 로딩 중
[onnxruntime] [CUDA] NVFP4 QMoE GEMV 최적화: ALU 바운드 커널의 한계를 넘어서는 방법NVFP4 양자화 디코딩 속도를 30% 이상 개선하고, MTP 검증 성능을 20배 이상 끌어올린 ONNX Runtime의 최적화 기법을 분석합니다.#CUDA#ONNXRuntime#LLM#Optimization#NVFP4#MoE2026년 8월 6일댓글 수 로딩 중
[논문리뷰] WorldClaw: Agentic 3D Open-World Generation at Scale본 논문은 대규모의 자유로운 탐색이 가능한 3D 월드를 생성할 때 발생하는 글로벌 공간 일관성과 로컬 콘텐츠 디테일 사이의 충돌 문제를 해결하고자 합니다 .#Review#3D Scene Generation#Agentic Framework#Procedural Terrain Generation#Open-World#Coarse-to-Fine#Multi-Modal LLM2026년 8월 6일댓글 수 로딩 중
[논문리뷰] World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation본 논문은 기존 VLA 모델들이 메인 뷰와 손목 뷰를 단순한 병렬 시각 입력으로만 취급하여 미세 조작(Fine-grained manipulation)에 필요한 정교한 동작 예측이 부족하다는 문제 의식에서 출발합니다.#Review#Vision-Language-Action (VLA)#Robot Manipulation#Future Wrist Modeling#Task-Conditioned Interface#Chain-of-Thought (CoT)#Flow-Matching#Real-time Control2026년 8월 6일댓글 수 로딩 중
[논문리뷰] Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains본 연구는 Modern Greek이 주요 multilingual retrieval 벤치마크 및 Nemotron 모델의 지원 언어에서 제외되어, 전문 도메인에서의 RAG 성능이 검증되지 않는 문제를 해결하고자 합니다.#Review#Modern Greek#Retrieval-Augmented Generation (RAG)#Dense Retrieval#BM25#Nemotron#Cross-Encoder#HERA2026년 8월 6일댓글 수 로딩 중
[논문리뷰] Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation기존의 다국어 임베딩 모델들은 다양한 하위 작업을 하나의 통합된 목표로 학습시키는데, 이는 작업 간의 상충되는 학습 신호를 발생시켜 특정 작업의 성능 향상이 다른 작업의 성능 저하로 이어지는 문제를 초래합니다.#Review#Multilingual Text Embedding#Flow Matching#Task-Conditional Adaptation#Contrastive Learning#Curriculum Learning#Representation Preservation2026년 8월 6일댓글 수 로딩 중
[논문리뷰] SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding본 논문은 기존의 Multimodal Large Language Models (MLLMs)가 3D 장면 이해 시 모든 모달리티를 고정된 방식으로 결합하여 발생하는 비효율성과 성능 저하 문제를 해결하기 위해 SmartMage를 제안합니다.#Review#3D Scene Understanding#Multimodal Learning#Adaptive Modality Selection#Mixture-of-Experts#Semantic-guided Routing#Embodied Intelligence2026년 8월 6일댓글 수 로딩 중
[논문리뷰] PaDoc: Layout-Grounded Parallel Decoding for Document Parsing본 논문은 기존의 end-to-end 문서 파서가 가진 고질적인 순차적 디코딩 문제를 해결하기 위해 고안되었다 .#Review#Document Parsing#Parallel Decoding#Multimodal Large Language Model (MLLM)#Layout-Grounded#Prefix-Conditioned Factorization#Ancestor Attention#Inference Efficiency2026년 8월 6일댓글 수 로딩 중
[논문리뷰] On-Policy Delta Distillation for Multilingual Math Reasoning본 논문은 LLM의 수학적 추론 능력을 향상시키기 위한 On-Policy Distillation 기법을 다국어(한국어, 일본어 등) 환경으로 확장하는 것을 목표로 합니다. 기존 연구들은 주로 영어 중심의 추론 벤치마크에 집중되어 있어, 비영어권 언어에서의 OPD 및 OPD^2^ 성능 검증이 미흡한 실정입니다.#Review#On-Policy Distillation#OPD^2^#Multilingual Math Reasoning#LLM Post-training#Reasoning Transfer#English-Korean Performance Gap2026년 8월 6일댓글 수 로딩 중
[논문리뷰] OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models본 연구는 CUA의 성능 평가와 강화학습에 필수적인 Reward 신호를 생성하는 VLM-as-a-Judge가 과연 신뢰할 수 있는지에 대한 근본적인 의문을 제기한다 .#Review#Computer-Using Agents#Reward Models#VLM-as-a-Judge#Trajectory Evaluation#OSReward#OS-Shepherd#Alignment2026년 8월 6일댓글 수 로딩 중