[논문리뷰] PoseShield: Neural Collision Fields for Human Self-Collision Resolution본 논문은 SMPL 기반의 인간 자세 추정 및 모션 생성 모델에서 발생하는 고질적인 자기 충돌(self-collision) 문제를 해결하는 것을 목적으로 합니다.#Review#SMPL#Self-Collision#Eikonal Equation#Neural Collision Field#Constrained Optimization#Motion Synthesis#Pose Space2026년 6월 29일댓글 수 로딩 중
[논문리뷰] PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents본 논문은 기존의 Safeguarding 기술이 주로 악의적인 콘텐츠나 jailbreak 방지에만 치중하고 있어, 에이전트의 복잡한 절차적 정책 준수(Policy adherence) 문제를 해결하는 데 한계가 있다는 점을 지적합니다 .#Review#LLM Agents#Policy Adherence#Dialogue-Grounded#Verifier#Tool-Calling#Safeguarding#Procedural Compliance2026년 6월 29일댓글 수 로딩 중
[논문리뷰] One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models본 논문은 현대의 monocular depth foundation models가 투명한 장면(transparent scenes)과 같은 다층 기하학적 구조를 단일 scalar depth로만 표현해야 하는 근본적인 한계(single-layer constraint)를 해결하고자 한다 .#Review#Monocular Depth Estimation#Geometric Ambiguity#Laplacian Visual Prompting#Foundation Models#Ordinal Benchmark#Layered Geometry2026년 6월 29일댓글 수 로딩 중
[논문리뷰] One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding본 논문은 MLLM 기반의 GUI Grounding에서 나타나는 비효율성과 정확도 저하 문제를 해결하고자 합니다. 기존의 ZoomIn 계열 방식은 타겟 영역을 외부에서 크롭하여 두 번 추론(Two-pass)함으로써 정확도를 높였으나, 이는 Latency를 증가시키고 계산 비용을 높이는 원인이 됩니다.#Review#GUI Grounding#MLLM#Cross-Layer Evidence#Coordinate Generation#InnerZoom#Efficient Inference#Region-to-Point Gap2026년 6월 29일댓글 수 로딩 중
[논문리뷰] OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks본 논문은 기존의 컴퓨터 사용 벤치마크들이 지나치게 단기적이고 단순한 작업 위주로 구성되어 있어, 실제 실무 환경에서의 복잡한 Long-Horizon 업무를 평가하기에 한계가 있다는 점을 지적한다.#Review#Computer-Use Agents#Long-Horizon Tasks#Benchmark#Multimodal Agents#Reasoning#Task-Level Planning#Autonomous Agents2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis본 논문은 기존 Masked Discrete Diffusion Model이 가진 자기 교정 능력의 부재와 대규모 코드북 학습의 어려움을 해결하기 위해 Nemotron-Labs-Diffusion-Image (NLD-Image)를 제안한다.#Review#Masked Discrete Diffusion#Text-to-Image Synthesis#Token Editing#Grouped Cross-Entropy#Codebook Sparsity#Self-Correction#High-Resolution Generation2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting본 논문은 3DGS를 모바일 플랫폼에 배포할 때 발생하는 높은 추론 및 저장 비용 문제를 해결하는 것을 목적으로 합니다.#Review#3D Gaussian Splatting#Mobile Rendering#Monte Carlo Specular Energy Aggregator#Spherical Harmonics#Multi-view Densification#Real-time Rendering2026년 6월 29일댓글 수 로딩 중
[논문리뷰] MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation본 논문은 Normalizing Flows (NFs)의 엄격한 가역성이 저수준 픽셀 디테일에 모델 용량을 과도하게 소모하게 하여, 고수준 시맨틱 구조를 포착하는 데 한계가 있다는 문제를 해결하고자 합니다.#Review#Normalizing Flows#Masked Image Modeling#End-to-End Generation#Variational Inference#Latent Representation#Token Bottleneck2026년 6월 29일댓글 수 로딩 중
[논문리뷰] LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing본 논문은 실시간 스트리밍 비디오 편집 환경에서 발생하는 Attention distribution shift와 Spatial-temporal token redundancy 문제를 해결하고자 한다 .#Review#Streaming Video Editing#Diffusion Models#Distillation#Real-Time Inference#Attention Distribution#Mask Cache#Autoregressive Generation2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Learning Transferable Dynamics Priors from Action to World Modeling본 논문은 대규모 로봇 데이터를 활용하여 범용적인 Dynamics Priors를 학습하고, 이를 통해 로봇 학습의 시뮬레이터와 정책 성능을 동시에 향상시키는 것을 목표로 합니다.#Review#Robot Learning#World Modeling#Diffusion Models#Dynamics Priors#Action-Conditioned#Policy Evaluation#Sim-to-Real2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Large-Scale Tunnel Air-Ground Collaboration With FLISP: Fast LiDAR-IMU Synchronized Path Planner대규모 수력 발전 터널과 같은 대형 인프라 점검은 현재 수작업에 의존하고 있어 매우 위험하고 비효율적입니다. 기존의 map-based multi-robot 시스템은 이러한 긴 터널 환경에서 SLAM 드리프트와 계산 부하 문제로 인해 안정적인 운용이 어렵습니다.#Review#Path Planning#LiDAR-IMU#Air-Ground Collaboration#Tunnel Inspection#Mapless#Heterogeneous Multi-Robot#Obstacle Avoidance2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Interleaved Speech Language Models Latently Work In Text본 논문은 Interleaved Speech-Text LMs의 내부 latent space에서 음성과 텍스트 모달리티가 어떻게 상호작용하는지에 대한 불투명성을 해결하고자 한다.#Review#Speech Language Models#Interleaved Training#Logit Lens#Implicit Transcription#Multimodal Latent Space#Cross-modal Alignment2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation본 논문은 기존 MLLM이 텍스트와 이미지를 교차로 생성하는 Free-form interleaved task에서 겪는 성능 한계를 해결하고자 합니다.#Review#Multimodal Large Language Models#Interleaved Generation#Unified Paradigm#Classifier-Free Guidance#ILScore#Data Pipeline#Cross-Modal Continuity2026년 6월 29일댓글 수 로딩 중
[논문리뷰] How Good Can Linear Models Be for Time-Series Forecasting?본 논문은 시계열 예측 분야에서 모델의 복잡도를 높이는 것이 성능 향상을 보장한다는 기존의 통념을 반박하고, 선형 모델의 한계가 모델 자체의 capacity가 아닌 부적절한 Preprocessing 설정에서 기인함을 증명합니다.#Review#Time-Series Forecasting#Ridge Regression#Preprocessing#Hyperparameter Optimization#Context Length#Normalization#Forecasting Diagnostic2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Geometric Stability of Neural Population Codes: Regional Variation, Behavioral Relevance, and Circuit Dependence본 연구는 neural population code의 신뢰성을 평가하는 기존의 Temporal Stability 및 Centroid 기반 프레임워크가 놓치고 있는 핵심 축인 Geometric Stability를 정의하고 분석하고자 합니다.#Review#Representational Geometry#Neural Population Code#Geometric Stability#Representational Drift#Split-Half Reliability2026년 6월 29일댓글 수 로딩 중
[논문리뷰] GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots본 논문은 GUI agent 학습 시 발생하는 데이터 확보의 고비용 문제와 이로 인한 성능 저하를 해결하기 위해 제안되었습니다.#Review#GUI Agent#Weakly-Supervised Learning#Reinforcement Learning#Visual Grounding#Curriculum Learning#Data Efficiency2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE본 연구는 기존 Diffusion MoE 프레임워크에서 발생하는 불균형한 계산 자원 배분 문제를 해결하고자 합니다.#Review#Diffusion Models#Mixture-of-Experts#Saliency-Aware Routing#Post-Training#Visual Generation#Latent Features2026년 6월 29일댓글 수 로딩 중
[논문리뷰] DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model본 논문은 제한된 컴퓨팅 환경에서 Real-time 인터랙티브 시뮬레이션을 가능하게 하는 DreamForge-World 0.1 Preview를 제안합니다 .#Review#World Model#Interactive Generation#Real-time#Consumer GPU#Autoregressive#Multimodal#LoRA2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction본 연구는 문항 난이도 예측을 문항 텍스트 기반의 정적 정보에서 벗어나, 학습자가 문항을 해결할 때 겪는 인지적 부하(Problem-solving burden)라는 동적 관점으로 전환하고자 합니다.#Review#Large Reasoning Models#Item Difficulty Prediction#Schoenfeld’s Episode Theory#Interpretability#Educational Assessment#Reasoning Traces2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction본 논문은 현대의 MLLM(Multimodal Large Language Models)이 VideoQA와 같은 피상적인 시각적 단서 인식에는 뛰어나지만, 영상 튜토리얼로부터 깊은 절차적 지식을 습득하고 이를 복잡한 하위 작업에 일반화하는 능력은 부족하다는 점을 문제로 제기합니다 .#Review#VideoQA#Video-Guided Agent#Keyframe Extraction#In-Context Learning#GUI Agents#Procedural Knowledge#Temporal Reasoning2026년 6월 29일댓글 수 로딩 중