[논문리뷰] SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments본 논문은 복잡한 클러터(Cluttered) 환경에서 언어 명령에 기반한 다중 실시체 파지 생성의 한계점을 해결하고자 합니다. 기존 연구들은 대규모 데이터셋과 고비용의 End-to-End 학습이 필요하거나, 복잡한 포즈 최적화 파이프라인에 의존하여 실시간성 및 일반화 성능이 부족하다는 문제가 있습니다.#Review#Dexterous Grasping#Natural Language#Multi-Embodiment#Flow Matching#Vision-Language Models#Robotic Manipulation2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models본 논문은 LLM에 대한 대규모 사실적 지식 주입의 신뢰성 및 확장성 문제를 해결하기 위해 Hypernetwork 기반 접근 방식을 제안합니다. 기존의 full fine-tuning이나 PEFT는 지식 주입 시 catastrophic forgetting과 OOD 일반화 부족이라는 한계를 지니고 있습니다.#Review#Hypernetworks#Knowledge Injection#Scaling Laws#Large Language Models#MegaWikiQA#Out-of-Distribution#LoRA2026년 7월 22일댓글 수 로딩 중
[논문리뷰] SLPO: Scaling Latent Reasoning via a Surrogate Policy본 연구는 latent reasoner가 명시적 CoT와 달리 결과 기반 RLVR을 활용한 test-time scaling의 이점을 누리지 못하는 문제를 해결하고자 한다.#Review#Latent Reasoning#Reinforcement Learning#Test-Time Scaling#Surrogate Policy#Adaptive Computation#Outcome-Reward RL2026년 7월 22일댓글 수 로딩 중
[논문리뷰] SLAM in Low-Light Environments: Project Report본 연구는 극심한 저조도 환경에서 기존 Visual SLAM 시스템의 낮은 신뢰성 문제를 해결하고자 한다. 대다수의 기존 SLAM 벤치마크는 조명이 충분한 실내 또는 주간 실외 환경에 집중되어 있어, 야간, 동굴, 또는 재난 현장과 같은 저조도 환경에서의 운영 능력은 검증되지 않았다.#Review#SLAM#Low-Light#Visual-Inertial#Feature-based SLAM#Localization#Mapping#Autonomous Navigation2026년 7월 22일댓글 수 로딩 중
[논문리뷰] SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD본 연구는 trillion-parameter 규모의 MoE 모델인 DeepSeek-V4를 Ascend SuperPOD 클러스터에서 학습할 때 발생하는 시스템적 병목 현상을 해결하고자 합니다.#Review#SLAI T-Rex#Ascend SuperPOD#DeepSeek-V4#Operations Research#AuraKernel#Full-Parameter Post-training2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment본 연구는 VLA 파인튜닝 시 발생하는 고질적인 성능 저하 문제를 해결하기 위해 Anchor-Align을 제안합니다.#Review#Vision-Language-Action Models#Robot Manipulation#Catastrophic Forgetting#Language-Action Alignment#Out-of-Distribution Generalization#Behavior Cloning2026년 7월 22일댓글 수 로딩 중
[논문리뷰] G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection본 연구는 항공 이미지 환경에서 RGB-T 객체 탐지를 수행할 때 직면하는 데이터 부족과 고비용 문제를 해결하기 위해 제안되었다. 기존의 항공 데이터셋 구축은 복잡한 환경에서 다수의 비행 및 Annotation 작업이 수반되어야 하므로 Viewpoint 제어와 모달리티 정렬에 한계가 있다.#Review#Synthetic Data Generation#Multi-View#RGB-T#Aerial Object Detection#Arma3#Benchmark#Oriented Bounding Box2026년 7월 22일댓글 수 로딩 중
[논문리뷰] FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video GenerationVideo Diffusion Transformers(Video DiTs)는 고해상도 및 장기 비디오 생성 시 발생하는 막대한 Attention 연산 비용이 추론의 주된 병목 현상으로 작용합니다.#Review#Video Diffusion Transformers#Adaptive Sparse Attention#Runtime Load Balancing#Ulysses#Sequence Parallelism#P2P Communication#Slack-Aware Sparse Augmentation2026년 7월 22일댓글 수 로딩 중
[논문리뷰] DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations본 논문은 현대의 autonomous agent들이 복잡한 디지털 문서(spreadsheet, presentation, PDF 등)를 다룰 때 요구되는 높은 수준의 구조적 일관성과 엔드투엔드(end-to-end) 작업 수행 능력을 체계적으로 평가하는 프레임워크가 부족하다는 점을 해결하고자 합니다.#Review#Autonomous Agents#Document Manipulation#Benchmarking#State Tracking#Deterministic Verification2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking본 논문은 RAG(Retrieval-Augmented Generation) 시스템에서 기존의 relevance 중심 평가 방식이 document set의 구조적 품질을 반영하지 못하는 한계를 해결하고자 한다.#Review#Retrieval-Augmented Generation#Document Set Selection#Evaluation Framework#LLM-as-a-Judge#Rubric-Oriented#Information Retrieval2026년 7월 22일댓글 수 로딩 중
[논문리뷰] Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization본 논문은 LLM의 추론 성능 향상을 위한 RL 학습에서 발생하는 Exploration Collapse 문제를 해결하는 것을 목표로 한다.#Review#Reinforcement Learning#Large Language Models#Riemannian Manifold#Policy Optimization#Exploration Collapse#Geometric Isometry#PPO2026년 7월 22일댓글 수 로딩 중
[논문리뷰] An Exam for Active Observers본 논문은 현대의 MLLM들이 능동적인 시각적 관찰(Active Observation) 능력을 갖추고 있는지에 대해 의문을 제기합니다. 현재의 비전-언어 벤치마크들은 대부분 정적인 이미지 설명이나 단순한 시각적 질의응답에 치중되어 있어, 복잡한 인지 과정에서 필요한 반복적인 시각적 재탐색 능력을 측정하지 못합니다 .#Review#Active Vision#MLLM#Benchmark#Perception-Reasoning Loop#Iterative Perception#Active Observation2026년 7월 22일댓글 수 로딩 중
[논문리뷰] ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion본 논문은 기존 Feed-forward 3DGS 방식들이 가진 과도하게 밀집된 3D Gaussian 분포 문제를 해결하기 위해 고안되었습니다.#Review#3D Gaussian Splatting#Feed-forward Models#Novel-view Synthesis#Adaptive Token Expansion#Compact Representation#Multi-view Capture2026년 7월 22일댓글 수 로딩 중
[flashinfer] FlashInfer의 Fused SwiGLU 및 NVFP4 양자화 최적화 분석SwiGLU 연산과 NVFP4 양자화를 하나로 통합하여 메모리 접근을 줄이고 성능을 최대 1.34배 향상시킨 최적화 기법을 소개합니다.#FlashInfer#CUDA#CuTe#Quantization#Performance2026년 7월 21일댓글 수 로딩 중
[sglang] SGLang LongCat-Flash Router GEMM 최적화: HPC-Ops bf16xfp32 커널로 H200에서 최대 4.31배 성능 향상SGLang의 LongCat-Flash 라우터 GEMM을 HPC-Ops 커널로 최적화하여 H200에서 최대 4.31배의 성능 향상을 달성한 과정을 분석합니다.#SGLang#GEMM#HPC-Ops#bf16#fp32#Optimization#DeepLearning#GPU#Hopper2026년 7월 21일댓글 수 로딩 중
[sglang] [SGLang] MoE Prefill의 혁신: DWDP(Distributed Weight Data Parallelism) 도입 분석MoE 모델의 Prefill 단계에서 All-to-All 통신 병목을 제거하고 NVLink를 통한 가중치 프리페칭으로 성능을 극대화하는 DWDP 기법을 살펴봅니다.#LLM#MoE#Distributed Computing#CUDA VMM#SGLang#Performance Optimization2026년 7월 21일댓글 수 로딩 중
[ultralytics] PyTorch EMA 업데이트 최적화: _foreach_lerp_를 활용한 성능 개선ModelEMA 업데이트 시 루프 기반 연산을 batched _foreach_lerp_로 교체하여 성능을 2.2배 향상하고 프로파일링 버그를 해결했습니다.#PyTorch#Performance#Optimization#EMA#DeepLearning2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training본 논문은 Mixture-of-Experts (MoE) 모델 학습 시 발생하는 방대한 Optimizer state 메모리 점유 문제를 해결하기 위해 고안되었습니다.#Review#Mixture-of-Experts (MoE)#Optimizer State#Tiered Allocation#SkewAdam#Memory Efficiency#Factored Second Moments#Bfloat162026년 7월 21일댓글 수 로딩 중
[논문리뷰] Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness본 연구는 장문 생성 모델의 사실성을 평가함에 있어 기존 Decompose-Search-Verify (DSV) 패러다임이 가진 Precision 중심의 편향성과 평면적 사실 확인(Boolean fact-checks)의 한계를 해결하고자 한다.#Review#Factual Completeness#Long-form Generation#Meta-Rubric#Benchmark#LLM-as-a-judge#Multimodal#Everyday Deep Research2026년 7월 21일댓글 수 로딩 중
[논문리뷰] Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing본 논문은 현대의 ASR 시스템이 혼재된 데이터로 학습됨에 따라 전사 스타일(Transcription Policy)이 제어 불가능한 Latent Variable로 남게 되는 문제를 해결합니다.#Review#Speech Recognition#Transcription Policy#Disfluency Detection#Word-level Timing#Cross-lingual Transfer#Verbatim ASR2026년 7월 21일댓글 수 로딩 중