[flashinfer] FlashInfer, SM100 아키텍처를 위한 BF16 x FP4 GEMM 최적화로 성능 극대화FlashInfer가 SM100 GPU를 위한 BF16 x FP4 GEMM 커널을 도입하여 추론 성능을 크게 향상시켰습니다.#FlashInfer#GEMM#BF16#FP4#NVIDIA GPU#최적화#딥러닝 추론2026년 8월 18일댓글 수 로딩 중
[sglang] SGLang 성능 최적화: DeepSeek-v4 SWA 인덱스 변환 Hoisting 및 백엔드 통합CUDA Graph 내부의 중복된 SWA 인덱스 변환을 제거하고 백엔드 간 버퍼 네이밍을 통일하여 유지보수성과 성능을 동시에 잡은 PR 분석#CUDA Graph#DeepSeek-v4#SGLang#Optimization#LLM2026년 8월 18일댓글 수 로딩 중
[vllm] vLLM, DeepSeek V3.2 커널의 대규모 토큰 처리 안정성 강화vLLM의 DeepSeek V3.2 커널에서 발생하던 대규모 단일 반복 토큰 처리 오류를 해결하여 안정성을 높였습니다.#vLLM#Triton#CUDA#최적화#딥러닝2026년 8월 18일댓글 수 로딩 중
[sglang] MiniMax-H3 모델을 24GB GPU에서 가속화하는 INT8 양자화 및 플러그형 어텐션 최적화MiniMax-H3 모델을 24GB GPU에서 실행하기 위해 INT8 양자화와 플러그형 어텐션 백엔드를 도입하여 최대 2.48배 성능을 향상했습니다.#SGLang#Diffusion#Optimization#INT8#GPU2026년 8월 18일댓글 수 로딩 중
[논문리뷰] WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations본 논문은 실세계 탐색(World Exploration)을 위한 비디오 생성 및 재구성 모델 학습 시 RGB 데이터만으로는 카메라 이동과 객체 움직임, 환경 조명 변화 등을 분리하기 어렵다는 근본적인 문제를 해결하고자 합니다.#Review#Synthetic Video#World Exploration#Unreal Engine#Multimodal Data#4D Reconstruction#Point Tracks2026년 8월 17일댓글 수 로딩 중
[논문리뷰] When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse본 논문은 RAG 시스템이 LLM의 지식 부족 문제를 효과적으로 해결하지만, Adversarial Documents 주입을 통한 Poisoning Attack에 취약하다는 핵심 문제를 다룹니다.#Review#Retrieval-augmented Generation#RAG Poisoning#Attention Collapse#Mechanistic Interpretability#LLM Security#Attack Detection#Document-Level Attention2026년 8월 17일댓글 수 로딩 중
[논문리뷰] VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding본 논문은 기존의 단일 턴(Single-turn) 방식 비디오 이해 벤치마크가 포화 상태에 이르렀으며, 복합적인 실세계 문제를 해결하는 능력을 평가하기에 부족하다는 점을 지적합니다. 기존 벤치마크에서는 최신 MLLMs가 90%에 육박하는 정확도를 보이며 성능 정체를 겪고 있습니다 .#Review#Multimodal Large Language Models#Video Understanding#Agentic AI#Tool-Augmented Interaction#Benchmark#Evidence-Grounded Reasoning2026년 8월 17일댓글 수 로딩 중
[논문리뷰] VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?본 논문은 멀티모달 에이전트가 사용자 쿼리를 바탕으로 3D 오픈 월드를 End-to-End로 구축하는 능력을 체계적으로 평가하고 개선하는 것을 목표로 합니다. 기존 연구들은 단순하고 이상적인 쿼리에만 의존하거나, 폐쇄형 프레임워크로 인해 일반화된 성능 평가와 훈련에 한계가 있었습니다.#Review#Multimodal Agents#3D Open World Construction#Agentic RL#VWE-Bench#VibeWorlding-Gym#Dual-Constraint Verifier#End-to-End2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs본 논문은 LLM inference API의 배포 단계에서 발생하는 불투명성과 그에 따른 모델 계약 위반 가능성을 해결하기 위해 Ventor-QTest를 제안합니다.#Review#LLM API Auditing#Deployment Verification#AFL (Average Fidelity Loss)#EFL (Extreme Fidelity Loss)#Black-box Audit#Stochastic Process#Coarsened-KL2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Understanding Cognition-Induced Risks in Agentic AI Systems본 논문은 최신 LLM 기반의 Agentic AI 시스템이 인간과 유사한 인지 패턴을 보이면서 발생하는 복합적인 사회적 위험을 규명하기 위해 작성되었다.#Review#Agentic AI#Large Language Models#Cognition-Induced Risks#Human-AI Interaction#Human Agency#Machine Consciousness#Safety Strategies2026년 8월 17일댓글 수 로딩 중
[논문리뷰] UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations본 논문은 Foundation GUI Agents의 실무 도입을 가로막는 training bottleneck과 interaction bottleneck을 해결하고자 합니다.#Review#Foundation GUI Agents#In-Context Demonstration#Environment-Grounded Training#Supervised Fine-Tuning#Reinforcement Learning#OSWorkerBench2026년 8월 17일댓글 수 로딩 중
[논문리뷰] TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation기존의 multi-reference image generation 벤치마크는 task-oriented 방식으로 구성되어 combinatorial setting에 부적합하며, 이는 incomplete coverage, no failure diagnosis, 그리고 uncontrolled complexity라는 세 가지 주요 한계를 야기한다.#Review#Multi-Reference Image Generation#Capability-Oriented Benchmark#Diagnostic Tree Analysis#Atomic Operators#Evaluation Protocol#Failure Localization#Compositional Formulas#Attribute Disentanglement2026년 8월 17일댓글 수 로딩 중
[논문리뷰] R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets본 논문은 현대의 LLM 시스템이 공유 예산(Shared Budget) 하에서 자신의 잠재적 역량을 실질적으로 발휘하지 못하는 문제를 해결하고자 합니다.#Review#Resource-Rationality#Shared-Budget#LLM#Agentic-Reasoning#Constraint-Optimization#Benchmark2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift본 논문은 오디오-텍스트 파운데이션 모델(ATM)이 심각한 음향 노이즈 환경에서 겪는 성능 급감 문제를 해결하고자 합니다.#Review#Audio-Text Foundation Models#Zero-Shot#Test-Time Adaptation#Acoustic Noise Robustness#Manifold Denoising#Affine Noise Hypothesis2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency본 연구는 LLM 기반의 검증 파이프라인에서 '이전에 완료된 감사-수정 작업'이 모델의 Verifier로서의 판단에 의도치 않은 편향을 유발하는지 규명하고자 합니다.#Review#LLM-as-a-judge#Verifier#False Alarm Rate#Signal Detection Theory#Context Bias#Audit-Repair2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems본 논문은 현대 과학적 탐구에서 AI Scientists가 단순히 독립적인 도구가 아닌, 팀의 핵심 구성원으로 통합되어야 하며, 이를 위해서는 '인간-에이전트 시스템(HAS)' 관점의 연구가 필수적이라고 주장합니다.#Review#Human-Agent Systems#Scientific Discovery#AI Scientists#Human-AI Synergy#Human-in-the-loop#Collaboration Advantage2026년 8월 17일댓글 수 로딩 중
[논문리뷰] PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments본 논문은 기존의 자율 진화 에이전트 평가가 고정된 환경 조건에 치중되어, 환경 변화 발생 시 적응 능력을 충분히 측정하지 못하는 한계를 해결하고자 합니다.#Review#Self-evolving Agents#Physics Adaptation#Code Evolution#Benchmark#Simulator-grounded#Mechanical Redesign2026년 8월 17일댓글 수 로딩 중
[논문리뷰] NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents본 논문은 디지털 문서와 카메라 촬영 문서 간의 파싱 격차를 해소하고, 복잡한 문서 구조를 정확하게 인식하기 위한 통합 솔루션 부재 문제를 해결합니다.#Review#Document Parsing#Vision-Language Models#Deformation-aware Learning#Content-Structure Decoupling#Layout Segmentation#OCR2026년 8월 17일댓글 수 로딩 중
[논문리뷰] MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling본 연구는 기존 파트 인식(part-aware) 3D 생성 방법론이 가진 확장성 한계를 해결하고자 합니다. 기존 방식들은 확산 모델(diffusion-based)에 의존하며, 파트 수가 증가함에 따라 메모리 요구량과 연산 비용이 지수적으로 증가하여 수백 개의 파트로 구성된 복잡한 객체 생성이 어렵다는 단점이 있습니다.#Review#3D Generation#Part-Aware#Autoregressive Modeling#Token-Efficient#VQ-VAE#Long-Context#Scalability2026년 8월 17일댓글 수 로딩 중
[논문리뷰] MOSS-VL Technical Report본 논문은 기존 비전-언어 모델(VLM)이 가진 Offline 중심의 비디오 이해 방식의 한계를 극복하기 위해 제안되었습니다.#Review#Vision-Language Model#Real-time Interaction#Gated Cross-Attention#XRoPE#Streaming Benchmarks#Multimodal Pre-training2026년 8월 17일댓글 수 로딩 중