[논문리뷰] An AI4AI Framework for Visual Token Pruning본 논문은 MLLM의 추론 성능을 저하시키지 않으면서 visual token 수를 효율적으로 줄이기 위한 자동화된 알고리즘 설계의 어려움을 해결하고자 합니다.#Review#Multimodal Large Language Models#Visual Token Pruning#Large Language Model Driven#Domain-Specific Language#Residual Search#Inference Optimization2026년 8월 13일댓글 수 로딩 중
[논문리뷰] Alaya-EVOKE: From Linear-Scaling Supervision to Endless World본 논문은 대화형 세계 모델(Interactive World Models)이 직면한 persistent memory, 반응성, 긴 생성 시간이라는 세 가지 상충하는 요구사항을 해결하는 것을 목표로 한다.#Review#Interactive World Models#Long-Horizon Generation#Geometric World State#Bounded Recurrent Process#Sparse Attention#Distribution Matching2026년 8월 13일댓글 수 로딩 중
[논문리뷰] AVA-Encoder: Towards Agent-Native Video Representation Learning본 논문은 비디오 생성 에이전트가 고품질의 영화 콘텐츠를 학습하고 재현하는 데 필요한 구조화된 표현이 부족하다는 문제를 해결한다. 기존의 낮은 수준의 시각적 표현(픽셀, 임베딩)은 에이전트의 해석과 조작이 어렵고, 단순 캡션 기반의 표현은 영화의 복잡한 구조와 세부 정보를 유지하지 못하는 한계가 있다.#Review#Agentic Video Encoder#Knowledge Graph Representation#Textual-Gradient#Self-Evolving Framework#Video Auto-Encoding#Cinematic Fidelity2026년 8월 13일댓글 수 로딩 중
[flashinfer] Gemma-4를 위한 Blackwell 최적화: FlashInfer의 비대칭 VO-Split NVFP4 구현 분석Gemma-4의 비대칭 헤드 구조(QK=512, VO=256)를 Blackwell GPU에서 NVFP4 KV 캐시로 최적화하는 과정을 살펴봅니다.#FlashInfer#Blackwell#NVFP4#Gemma-4#CUDA#LLM Inference2026년 8월 13일댓글 수 로딩 중
[sglang] SGLang의 Wan2.2-TI2V 최적화: Triton 커널을 통한 메모리 트래픽 병목 해결Wan2.2-TI2V 모델의 per-token adaLN 연산을 Triton 커널로 융합하여 메모리 복사를 제거하고 성능을 13% 향상시켰습니다.#SGLang#Triton#Diffusion#Optimization#GPU2026년 8월 13일댓글 수 로딩 중
[onnxruntime] WebGPU MatMulNBits 최적화: Subgroup Shuffle을 활용한 성능 향상WebGPU MatMulNBits 커널에서 Subgroup Shuffle을 도입하여 A 피연산자의 중복 메모리 읽기를 줄이고 성능을 크게 향상시킨 PR 분석#WebGPU#ONNX Runtime#MatMulNBits#Optimization#WGSL#Subgroup Shuffle2026년 8월 13일댓글 수 로딩 중
[sglang] SGLang의 FLUX.2 추론 최적화: Eager 모드에서의 커널 융합 기법FLUX.2 모델의 Eager 추론 성능을 높이기 위해 AdaLN과 SwiGLU 연산을 Triton 커널로 융합하여 12% 이상의 속도 향상을 달성했습니다.#SGLang#FLUX.2#Triton#Optimization#Inference2026년 8월 13일댓글 수 로딩 중
[flashinfer] FlashInfer SM120 MoE GEMM 최적화: 웨이브+잔여물 비용 모델 도입FlashInfer의 SM120 MoE GEMM 성능을 향상시키는 웨이브+잔여물 비용 모델 도입 및 타일 선택 개선.#AI#딥러닝#최적화#GPU#FlashInfer#MoE#GEMM#FP8#SM1202026년 8월 12일댓글 수 로딩 중
[sglang] [Diffusion] MiniMax-H3 비디오 인입 최적화: 87.5% 메모리 절감과 Zero-Copy의 마법Multi-GPU 환경에서 중복되는 비디오 디코딩을 제거하고, memfd와 mmap을 통해 호스트 레벨에서 데이터를 공유하여 메모리 효율을 극대화한 사례를 분석합니다.#Performance#Python#FFmpeg#Distributed-Computing#Memory-Optimization2026년 8월 12일댓글 수 로딩 중
[vllm] vLLM에 Dots3 NOTE 모델 네이티브 지원 추가: 멀티모달 및 하이브리드 MLA 최적화Dots3 NOTE 모델의 텍스트, 이미지, 오디오, 비디오 처리를 위한 vLLM 네이티브 통합 및 하이브리드 MLA 아키텍처 최적화 분석.#vLLM#LLM#Multimodal#MLA#Optimization2026년 8월 12일댓글 수 로딩 중
[vllm] vLLM의 성능 병목 해결: Host-to-Device 복사 최적화로 비동기 실행 보장하기vLLM에서 발생하는 비효율적인 H2D 복사 문제를 pinned memory 활용 및 스트라이드 최적화로 해결하여 성능을 개선한 사례를 분석합니다.#vLLM#CUDA#Performance Optimization#PyTorch#Deep Learning2026년 8월 12일댓글 수 로딩 중
[논문리뷰] ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents본 논문은 기존의 Agent 보안 연구가 수동으로 구현된 환경에 의존하여 확장성이 낮고, LLM 기반 도구 시뮬레이션의 확률적 성격으로 인해 재현 가능한 평가가 어렵다는 문제를 해결한다.#Review#LLM Agents#Indirect Prompt Injection#Adversarial Environment#Safety Alignment#Tool-use#Benchmarking2026년 8월 12일댓글 수 로딩 중
[논문리뷰] The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images본 논문은 'thinking-with-images' 패러다임을 사용하는 MLLM이 기대와 달리 직관적인 성능 향상을 보여주지 못하거나, 불필요한 연산으로 자원을 낭비하는 문제를 해결하고자 한다.#Review#Multimodal Large Language Models#Visual Tool-Use#Causal Inference#Policy Miscalibration#Thinking-with-Images#Visual Evidence Gain2026년 8월 12일댓글 수 로딩 중
[논문리뷰] StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization본 논문은 기존의 one-shot generative model이 가진 고질적인 편집 불가능성과 공간적 일관성 결여 문제를 해결하기 위해 StateFlow를 제안합니다.#Review#Previsualization#3D World State#Generative AI#Scene Generation#Camera Planning#State Evolution#Agentic Framework2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill본 논문은 기존의 자율 연구 에이전트들이 별도의 독립적인 플랫폼과 복잡한 오케스트레이션 인프라를 필요로 하는 폐쇄적 구조라는 점에 주목하여, 이를 코딩 어시스턴트 내부의 재사용 가능한 스킬 형태로 구현하고자 한다.#Review#Autonomous Research Agents#Research Paper Generation#Composable Skills#Coding Assistants#Self-Critique#Evidence-Grounded Generation#Editable Figures2026년 8월 12일댓글 수 로딩 중
[논문리뷰] SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries본 논문은 LLM Agent의 스킬 라이브러리가 확장됨에 따라 발생하는 Procedural Knowledge의 중복성과 컨텍스트 예산 부족 문제를 해결하고자 합니다.#Review#LLM Agents#Agent Skills#Procedural Memory#Graph Compression#Skill Retrieval2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Simplex Relaxation for Discrete Diffusion본 논문은 기존 Uniform Discrete Diffusion 모델에서 범주형 corruption 과정을 유지하면서도 학습 목적함수와 역방향 샘플러의 성능을 고도화하는 것을 목표로 합니다. 기존 연구들은 역방향 업데이트를 순수하게 범주형 상태만으로 설계하여 학습 및 샘플링 과정의 제약이 컸습니다 .#Review#Discrete Diffusion#Categorical Generation#Simplex Relaxation#Dirichlet-Categorical Augmentation#Rao-Blackwellized#Generative Perplexity2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models본 논문은 사전 학습된 VFMs가 훈련 과정에서 명시적인 다중 뷰 기하학적 일관성(multi-view geometric consistency)을 보장받지 못해 발생하는 불일치 문제를 해결하고자 합니다.#Review#Test-Time Adaptation#3D Vision Foundation Models#Geometric Consistency#Multi-View Reconstruction#LoRA#Epipolar Geometry2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Self-Evolving Embodied Agents via Skill-Harness Evolution본 논문은 Frozen 상태의 embodied agent가 새로운 환경에 직면했을 때 파라미터 업데이트 없이 효과적으로 적응할 수 있는 방법을 탐구합니다.#Review#Embodied Agents#Train-free Adaptation#Foundation Models#Skill Evolution#Harness Optimization#VLA#Rollout-guided Diagnosis2026년 8월 12일댓글 수 로딩 중
[논문리뷰] Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control본 논문은 LLM-agent 서비스의 결정론적 제어 경로(deterministic control path)가 빈번한 CPU-GPU 경계 이동으로 인해 시스템의 성능 병목을 유발하는 문제를 해결하고자 합니다.#Review#LLM-Agent#GPU Acceleration#Ready-Cohort Boundary#Host Round Trip#Agent Runtime#Deterministic Control2026년 8월 12일댓글 수 로딩 중