[sglang] SGLang: ROCm 환경에서 RMSNorm의 배치 불변성 확보를 통한 결정론적 추론 개선SGLang이 ROCm 환경에서 RMSNorm의 배치 불변성 문제를 해결하여 결정론적 추론을 가능하게 한 PR 분석.#SGLang#ROCm#RMSNorm#Batch Invariance#Deterministic Inference#LLM Optimization2026년 7월 5일댓글 수 로딩 중
[논문리뷰] VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon본 논문은 현대 VLA 정책이 고질적으로 겪는 'predict-then-blindly-execute' 패러다임의 한계를 해결하고자 합니다.#Review#VLA#Action Chunking#Latent-space Vision Monitor#Online Gradient Guidance#Embodied Intelligence#Adaptive Action Horizon#Corrective Inference2026년 7월 5일댓글 수 로딩 중
[논문리뷰] The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning본 논문은 LLM RL 파이프라인에서 발생하는 Training-Inference Mismatch가 단순히 알고리즘적 오류를 넘어 Objective Misalignment를 유발한다는 점을 지적한다.#Review#Large Language Model#Reinforcement Learning#Training-Inference Mismatch#Monotonic Policy Improvement#Policy Optimization#Alignment2026년 7월 5일댓글 수 로딩 중
[논문리뷰] Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming본 논문은 현대 AI 인프라가 급격히 성장함에 따라 기존 보안 도구가 해결하지 못하는 새로운 공격 표면이 형성되었음을 지적합니다. .#Review#AI Security#Agent Red Teaming#Model Context Protocol (MCP)#Infrastructure Scanning#LLM-driven Auditing#Supply Chain Security2026년 7월 5일댓글 수 로딩 중
[논문리뷰] OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers본 논문은 Diffusion Transformers의 추론 효율성을 높이기 위해 데이터 보정(calibration)이 필요 없는 새로운 Post-Training Quantization (PTQ) 프레임워크인 OrbitQuant를 제안합니다.#Review#Diffusion Transformers#Post-Training Quantization#Data-Agnostic#RPBH Rotation#Distributional Codebook#Inference Efficiency2026년 7월 5일댓글 수 로딩 중
[논문리뷰] MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering본 논문은 긴 멀티모달 문서에서 생성된 답변의 근거를 정확히 찾아내는 Multimodal Attribution 문제를 해결하고자 합니다. 기존의 연구들은 주로 텍스트 기반의 단일 모달(unimodal) 설정에 집중되어 있어, 텍스트와 이미지가 혼재된 실제 문서에서의 복합적인 근거를 로컬라이징하는 데 한계가 있습니다.#Review#Multimodal Attribution#Long Document#Training-Free#Mechanistic Interpretability#Attention Heads#Causal Mediation Analysis#MultAttrEval2026년 7월 5일댓글 수 로딩 중
[논문리뷰] Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment본 논문은 기존의 클라우드 제거(CR) 방법론들이 시각적 현실성(visual realism)에만 치중하여 정작 중요한 하위 분석 작업(downstream interpretation)의 신뢰성을 떨어뜨리는 문제를 해결하고자 합니다.#Review#Cloud Removal#Observation-Anchored Residual Flow#Geo-Contextual Prior Alignment#Vision Foundation Model#Semantic Integrity#Remote Sensing2026년 7월 5일댓글 수 로딩 중
[논문리뷰] Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots본 논문은 현대의 Embodied AI 모델들이 요구하는 복잡한 실행 조건을 기존의 범용 LLM/VLM 추론 런타임이 충족하지 못하는 문제를 해결하고자 합니다.#Review#Embodied AI#Inference Runtime#VLA#WAM#C++#Heterogeneous Computing#Closed-loop Control2026년 7월 5일댓글 수 로딩 중
[논문리뷰] DataComp-VLM: Improved Open Datasets for Vision-Language Models본 논문은 현대의 Autoregressive VLM 학습에서 데이터 큐레이션 전략이 모델 성능을 결정짓는 핵심 요소임에도 불구하고, 이에 대한 표준화된 벤치마크가 부족하다는 점을 해결하고자 합니다.#Review#Vision-Language Models#Data Curation#Benchmark#Instruction-Tuning#Data Mixing#Scaling Laws#Pretraining2026년 7월 5일댓글 수 로딩 중
[논문리뷰] AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer본 논문은 기존 bokeh editing 기법들이 주로 AIF 이미지를 입력으로 전제하거나, 입력 이미지를 AIF로 강제 변환하여 처리함으로써 발생하는 한계점을 해결하고자 한다.#Review#Any-to-Any Bokeh Editing#Optical Fingerprint Transfer#Circle-of-Confusion (CoC)#Relative Blur Synthesis#Dual-CoC Conditioning#Physics-Guided Rendering2026년 7월 5일댓글 수 로딩 중
[논문리뷰] AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation현재 GraphRAG 연구는 그래프의 복잡한 관계를 LLM이 효과적으로 이해하도록 하는 데 어려움을 겪고 있다. 특히 기존의 비모수적(non-parametric) 검색 방식은 그래프 내 필수적인 구조 정보를 누락하거나 중복되는 노드를 포함하는 경우가 많아, 전체적인 검색 정확도와 추론 성능을 저하시키는 원인이 된다.#Review#GraphRAG#Adaptive-masking#Graph Embedding#Self-Supervised Learning#JEPA#Reinforcement Learning2026년 7월 5일댓글 수 로딩 중
[vllm] vLLM XPU 백엔드 최적화: W8A8 및 W8A16 FP8 Linear 커널 도입vLLM의 XPU 백엔드에 W8A8 및 W8A16 FP8 Linear 커널을 추가하여 다양한 양자화 세분성을 지원하고 성능을 최적화했습니다.#vLLM#XPU#FP8#Quantization#LLM2026년 7월 4일댓글 수 로딩 중
[uv] uv, 휠 파일명 파싱 최적화: 중복 작업 제거와 성능 향상uv가 휠 파일명 파싱 시 중복되는 패키지 이름 정규화 작업을 제거하여 성능을 개선한 PR을 분석합니다.#uv#performance#optimization#python#wheel2026년 7월 4일댓글 수 로딩 중
[vllm] vLLM의 Dynamic Speculative Decoding을 위한 Full CUDA Graph 최적화Dynamic Speculative Decoding(DSD)에서 MRv2와 Full CUDA Graph를 결합하여 추론 성능을 극대화하는 최적화 기법을 소개합니다.#vLLM#CUDA Graph#Speculative Decoding#LLM#Performance Optimization2026년 7월 4일댓글 수 로딩 중
[uv] Interning을 통한 uv의 Simple API 파싱 최적화: 메모리와 속도 두 마리 토끼 잡기중복되는 requires-python 명세서를 Interning하여 메모리 사용량을 10% 줄이고 파싱 속도를 개선한 uv의 최적화 기법을 살펴봅니다.#Rust#Optimization#uv#Python#Interning#Performance2026년 7월 4일댓글 수 로딩 중
[flashinfer] FlashInfer의 새로운 TGV GEMM 백엔드: CuTeDSL을 활용한 Blackwell 최적화FlashInfer에 Blackwell 아키텍처를 위한 고성능 TGV GEMM 백엔드가 추가되었습니다. CuTeDSL 기반의 2-CTA 모드로 성능을 극대화합니다.#FlashInfer#GEMM#CUDA#Blackwell#CuTeDSL#GPU Optimization2026년 7월 3일댓글 수 로딩 중
[sglang] SGLang: performance_mode=speed에서 torch.compile 기본 활성화로 성능 최적화SGLang의 'speed' 모드에서 torch.compile을 기본 활성화하여 성능을 극대화하는 PR 분석.#SGLang#PyTorch#torch.compile#성능 최적화#GPU#JIT 컴파일2026년 7월 3일댓글 수 로딩 중
[uv] uv의 성능 최적화: BTreeSet에서 Vec으로의 전환을 통한 site-packages 스캔 오버헤드 개선uv의 site-packages 스캔 과정에서 BTreeSet 대신 Vec을 사용하여 메모리 할당 오버헤드를 줄이고 성능을 최적화한 사례를 분석합니다.#uv#rust#performance#optimization#python2026년 7월 3일댓글 수 로딩 중
[vllm] [vLLM] Triton 커널 최적화로 Unlimited-OCR 성능 3.7배 끌어올리기: R-SWA의 효율적 구현Unlimited-OCR의 R-SWA 마스크를 TritonAttention 백엔드에 직접 구현하여 FlexAttention 대비 최대 3.7배의 성능 향상을 달성한 과정을 분석합니다.#vLLM#Triton#LLM Optimization#Attention#R-SWA#OCR2026년 7월 3일댓글 수 로딩 중
[논문리뷰] WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory본 논문은 기존 비디오 월드 모델이 시야를 벗어난 객체의 움직임과 정체성을 유지하지 못하는 문제를 해결하기 위해 WorldDirector를 제안합니다.#Review#World Model#Video Generation#Dynamic Memory#Object Permanence#Controllable Simulation#Flow Matching#Spatial-Aware Control2026년 7월 2일댓글 수 로딩 중