[sglang] [NPU] GLM-4.7-Flash 성능 최적화: Fused Triton 커널로 연산 병목 해결하기Split과 RMSNorm 연산을 하나로 합친 Fused Kernel을 도입하여 GLM-4.7-Flash 모델의 NPU 추론 성능을 대폭 개선했습니다.#NPU#Triton#Optimization#DeepSeek-V2#SGLang#LLM Inference2026년 6월 30일댓글 수 로딩 중
[onnxruntime] ONNX Runtime QMoE SwiGLU GEMV 최적화: Split-K2 커널로 LLM 추론 가속화ONNX Runtime의 Split-K2 SwiGLU GEMV 커널로 QMoE FC1 레이어 성능을 개선합니다.#ONNXRuntime#CUDA#GEMV#Split-K2#LLM#Optimization#SwiGLU#QMoE2026년 6월 30일댓글 수 로딩 중
[vllm] vLLM에 고성능 추론을 위한 HPC-Ops Attention 백엔드 도입Tencent의 HPC-Ops 라이브러리를 vLLM에 통합하여 FP8 모델 추론 성능을 최적화하는 방법#vLLM#LLM#HPC#FP8#Attention2026년 6월 30일댓글 수 로딩 중
[open-webui] Open WebUI 성능 최적화: Svelte 컴포넌트에서 불필요한 HTML 재정제 방지Svelte 컴포넌트에서 스트리밍 업데이트 시 불필요한 HTML 재정제를 방지하여 렌더링 성능을 크게 개선합니다.#Svelte#Performance#Optimization#DOMPurify#Frontend#WebUI2026년 6월 29일댓글 수 로딩 중
[flashinfer] FlashInfer의 TRTLLM-Gen MoE 라우팅 최적화: 레지스터 압박 해소와 성능 극대화MoE 라우팅 커널의 스레드 블록 크기를 동적으로 최적화하여 레지스터 압박을 줄이고 고성능을 달성한 사례 분석.#FlashInfer#MoE#CUDA#GPU Optimization#TRTLLM2026년 6월 29일댓글 수 로딩 중
[vllm] vLLM의 성능 극대화: Helion 커널을 활용한 fused_qk_norm_rope 최적화vLLM에 Helion 커널을 도입하여 fused_qk_norm_rope 연산 성능을 H100 기준 최대 1.38배 향상시킨 사례 분석.#vLLM#Helion#KernelOptimization#CUDA#LLM2026년 6월 29일댓글 수 로딩 중
[faster-qwen3-tts] Qwen3-TTS, GGML 백엔드 통합으로 속도 혁신: C++ 네이티브 백엔드의 놀라운 성능 향상Qwen3-TTS에 GGML 백엔드를 통합하여 C++ 네이티브 구현을 통해 획기적인 성능 개선을 달성했습니다.#Qwen3-TTS#GGML#성능 최적화#C++#TTS2026년 6월 29일댓글 수 로딩 중
[논문리뷰] ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval본 논문은 패션 도메인 특화 미세 조정(fine-tuning) 과정에서 발생하는 Domain-specific Specialization과 OOD Generalization 간의 근본적인 Tradeoff 문제를 해결하는 데 집중합니다.#Review#Vision-Language Encoder#Fashion Retrieval#Knowledge Distillation#WiSE-FT#Contrastive Learning#OOD Generalization#Model Soups2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Walking in the Implicit: Interactive World Exploration via Neural Scene Representation본 논문은 기존의 카메라 제어 기반 상호작용 세계 모델(Interactive World Model)들이 겪는 장기적인 일관성 유지 문제를 해결하고자 합니다.#Review#Interactive World Exploration#Camera-Controlled Generation#Neural Implicit Scene#Neural Scene Representation#Diffusion Transformer2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning본 논문은 현재의 MLLMs가 비디오 내의 동적인 시각적 증거를 바탕으로 논리적 추론을 수행하는 데 있어 심각한 한계를 가지고 있음을 지적한다.#Review#Video-MME-Logical#Temporal-Logical Reasoning#MLLMs#Diagnostic Benchmark#Programmatic Generation#Intermediate-State Evaluation2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Trimming the Long-Tail of Visual World Modeling Evaluation본 논문은 현대의 World Models가 물리적 원리를 진정으로 내재화했는지, 아니면 학습 데이터의 통계적 규칙성에 의존하는지에 대한 근본적인 의문을 제기합니다.#Review#Visual World Modeling#Long-Tail Scenarios#Physical Reasoning#Affordance Generalization#Multimodal Generative Models#Benchmark2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TheoremGraph: Bridging Formal and Informal Mathematics현대 수학 연구는 거대하고 파편화되어 있어 수학적 결과들의 의존성 구조를 명확히 파악하기 어렵습니다. 논문 저자들은 informal한 문헌(arXiv 등)이 주로 문서 수준의 인용에 의존하는 반면, formal 라이브러리(Lean 등)는 매우 제한된 범위 내에서만 세밀한 의존성을 관리한다는 한계를 지적합니다.#Review#Formal-Informal Mathematics#Dependency Graph#LeanGraph#Neural Theorem Proving#Cross-modal Retrieval#Autoformalization2026년 6월 29일댓글 수 로딩 중
[논문리뷰] The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction본 논문은 기존의 egocentric 4D 손 모션 재구성 방법론이 직면한 심각한 병목 현상을 해결하고자 합니다. 기존 방식들은 이미지 기반 탐지기(Detector)에 의존하거나, 제한된 데이터로 학습된 시간적 모듈을 사용하여 심한 은닉 상황에서 성능이 저하되는 한계가 있습니다 .#Review#Video Diffusion Models#Hand Motion Reconstruction#Egocentric Video#4D Reconstruction#Embodied AI#Occlusion Reasoning2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents본 논문은 기존 컴퓨터 사용 벤치마크들이 GUI 환경이나 특정 도메인(주로 코딩)에 편향되어 있어, 일반적인 터미널 환경에서의 범용적인 에이전트 능력을 평가하는 데 한계가 있다는 문제 의식에서 출발합니다.#Review#Terminal-Use Agents#General-Purpose Benchmark#Command-Line Interface#Execution-Grounded Evaluation#Scientific Workflows2026년 6월 29일댓글 수 로딩 중
[논문리뷰] TACO: Tool-Augmented Credit Optimization for Agentic Tool Use본 논문은 에이전트의 불필요하거나 오도하는 도구 호출 문제를 해결하기 위해, 도구 호출 자체의 기여도를 정밀하게 평가하는 최적화 프레임워크를 제안한다.#Review#Agentic Tool Use#Reinforcement Learning#Multimodal Models#Credit Assignment#Tool-Augmented Credit Optimization#GRPO#Differential Answer-Probe Reward2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent본 논문은 에이전트 모델의 성능을 향상시키기 위한 기존의 파라미터 스케일링 전략이 갖는 높은 비용과 재현성 문제를 해결하기 위해 에이전트 호라이즌(Horizon) 확장을 제안합니다 .#Review#Agents-A1#Long-Horizon#Knowledge-Action Graph#Mixture-of-Experts#On-Policy Distillation#Salient Vocabulary Alignment2026년 6월 29일댓글 수 로딩 중
[논문리뷰] SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing본 논문은 기존의 고정된 위험 분류 체계에 의존하는 Guardrail이 실제 애플리케이션의 가변적인 요구사항을 충족하지 못하는 문제를 해결하고자 합니다 .#Review#In-context Policy Guardrailing#Safety Benchmark#Hierarchical Evaluation#LLM Safety#Rule Dependency#Policy Framework2026년 6월 29일댓글 수 로딩 중
[논문리뷰] ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models본 연구는 LRMs가 생성하는 지나치게 긴 Chain-of-Thought 추론 과정이 야기하는 '투명성 부담(Transparency burden)' 문제를 해결하고자 합니다.#Review#Large Reasoning Models#Chain-of-Thought#Diagnostic Auditing#Hierarchical Visualization#Agentic Diagnosis#Systemic Profiling2026년 6월 29일댓글 수 로딩 중
[논문리뷰] ReFreeKV: Towards Threshold-Free KV Cache Compression본 논문은 기존의 KV cache pruning 연구들이 특정 데이터셋이나 도메인에 종속된 Budget Threshold 설정에 지나치게 의존하여, 실제 환경의 가변적인 입력 처리에 한계가 있다는 점을 지적한다.#Review#KV Cache Compression#Threshold-Free#Large Language Models#Attention Sparsity#Inference Efficiency#Dynamic Budgeting2026년 6월 29일댓글 수 로딩 중
[논문리뷰] RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation본 논문은 현대 컴퓨터 비전의 핵심인 VFM이 가지는 고해상도 정보 부족 문제를 해결하기 위해 RaysUp을 제안한다 . 기존의 feature upsampling 방식들은 고정된 2D 인접 영역에 의존하거나 특정 모델에 종속되어 재학습이 필요한 등 범용성과 효율성 측면에서 한계가 있다.#Review#Feature Upsampling#Vision Foundation Models#Ray Representation#Geometry-Aware#Cross-Attention#3D Geometric Priors2026년 6월 29일댓글 수 로딩 중