[논문리뷰] ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning본 논문은 기존 의료용 MLLM 평가 체계가 최종 답변의 정확도만 판단할 뿐, 환각(Hallucination)이 발생하는 근본적인 원인을 규명하지 못하는 한계를 해결하고자 합니다.#Review#Medical MLLM#Hallucination Diagnosis#Chain-of-Thought#Multimodal Reasoning#Stage-wise Evaluation#Stage-Replacement Intervention2026년 6월 14일댓글 수 로딩 중
[논문리뷰] CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving본 논문은 자율주행 시스템이 상호작용 상황에서 발생하는 False-Veto 문제를 효과적으로 해결하고, 이를 위한 인증 가능한 수정 메커니즘을 정의하는 것을 목표로 한다.#Review#Autonomous Driving#Interactive Repair Certification#Cooperation Envelope#Right-of-Way#Safety Filtering2026년 6월 14일댓글 수 로딩 중
[논문리뷰] Benchmarking AI Agents for Addressing Scientific Challenges Across Scales본 논문은 기존 AI agent 벤치마크가 과학 연구의 복잡성과 상호작용적인 성격을 충분히 반영하지 못하는 한계를 해결하고자 합니다. 기존의 연구들은 지나치게 정적인 과제에 국한되어 있거나, 과학적 도메인의 특수성(데이터의 이질성, 다단계 의존성 등)을 고려하지 않아 실질적인 과학적 기여도를 측정하는 데 미흡했습니다.#Review#AI Agents#Scientific Discovery#Benchmarking#Computational Science#Multi-scale Modeling#Evaluation Framework2026년 6월 14일댓글 수 로딩 중
[논문리뷰] Avatar V: Scaling Video-Reference Avatar Video Generation본 연구는 기존의 아바타 생성 방식이 가진 Generalization 부족과 Efficiency 문제를 해결하기 위해 대규모 데이터 기반의 Scaling 접근 방식을 제안합니다. 기존의 개별 모델 학습 방식은 특정 피사체에 종속되어 있어 다양한 인물과 동작을 일반화하는 데 한계가 있었습니다.#Review#Avatar Generation#Video-Reference#Scaling Law#Diffusion Models#Neural Rendering#Computer Vision2026년 6월 14일댓글 수 로딩 중
[논문리뷰] An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models본 논문은 Large Reasoning Models가 추론 결과 생성에는 탁월한 성능을 보임에도 불구하고, 논리적 오류를 평가하는 능력에서는 심각한 결함을 보이는 Production-Evaluation Gap 문제를 제기한다.#Review#Large Reasoning Models#Production-Evaluation Gap#Answer Confirmation Bias#Reasoning Evaluation#Chain-of-Thought#Causal Patching2026년 6월 14일댓글 수 로딩 중
[논문리뷰] AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models본 논문은 Multimodal Foundation Models (MFMs)가 물리적 세계의 3D 공간을 추론하는 데 있어 근본적인 한계를 지니고 있음을 지적합니다.#Review#AlloSpatial#Spatial Reasoning#Allocentric Cognitive Mapping#World2Mind#Spatial Reasoning Harness#Foundation Models#Reinforcement Learning2026년 6월 14일댓글 수 로딩 중
[논문리뷰] AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization본 논문은 실시간 스트리밍 환경에서 LLM이 적응형으로 추론하도록 최적화하는 AdaSR 프레임워크를 제안한다. 기존의 스트리밍 추론 연구들은 주로 감독 학습(Supervised Fine-tuning)에 의존하고 있어, 모델이 다양한 입력 상황에 맞춰 능동적으로 추론 여부를 결정하는 유연성이 부족하다.#Review#Streaming Reasoning#Reinforcement Learning#Hierarchical Relative Policy Optimization#Adaptive Computation#Large Language Models#Chain-of-Thought2026년 6월 14일댓글 수 로딩 중
[논문리뷰] ActiveMimic: Egocentric Video Pretraining with Active Perception본 논문은 대규모 Egocentric Human Video를 로봇 학습에 활용할 때 발생하는 성능 저하의 핵심 원인이 '능동적 인식(Active Perception) 정보의 부재'에 있음을 규명합니다 .#Review#Robot Manipulation#Egocentric Human Video#Active Perception#Robot Pretraining#Unified Action Representation2026년 6월 14일댓글 수 로딩 중
[논문리뷰] APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies본 논문은 continuous-action 기반 VLA 모델이 겪는 OOD 언어 일반화 성능 저하 문제를 해결하기 위해 APT (Action Expert Pretraining)를 제안합니다.#Review#Vision-Language-Action#Language Generalization#Action Expert Pretraining#Bayesian Factorization#Visuomotor Prior#Gated Fusion2026년 6월 14일댓글 수 로딩 중
[논문리뷰] APPO: Agentic Procedural Policy Optimization본 논문은 기존 Agentic RL의 조잡한(coarse) 보상 할당(credit assignment) 문제를 해결하고자 합니다.#Review#Agentic Reinforcement Learning#Credit Assignment#Procedural Reasoning#Decision Points#Branching Score#Policy Optimization2026년 6월 14일댓글 수 로딩 중
[논문리뷰] Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback본 논문은 현대의 T2I 모델이 생성하는 이미지의 국소적이고 미묘한 결함을 효과적으로 진단하고 해결하지 못하는 기존 scalar 기반 평가 방식의 한계를 해결하고자 합니다.#Review#Text-to-Image#Structured Defect Grounding#VLM#Diffusion Model Alignment#Reinforcement Learning#BoxFlow-GRPO#Dataset2026년 6월 11일댓글 수 로딩 중
[논문리뷰] WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces기존의 컴퓨터 에이전트 평가 벤치마크는 주로 단일 브라우저 기반 작업에 국한되어 있어, 실제 데스크톱 환경의 복잡한 Long-Horizon 작업 수행 능력을 평가하는 데 한계가 있습니다.#Review#Computer-Use Agent#Long-Horizon#Real-World Benchmark#Hybrid Interface#Human-Computer Interaction#Agent Evaluation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation본 논문은 기존 월드 모델들이 복잡한 매니퓰레이션 태스크를 수행할 때 겪는 High Latency와 Context Length의 제한 문제를 해결하고자 한다.#Review#World Model#Robotic Manipulation#Autoregressive Inference#Transformer#Efficiency#Generative Modeling2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning본 논문은 기존의 단일 체인 추론(Single-chain Reasoning) 방식이 시각적 추론 과정에서 범하는 조기 지각적 확신(Early Perceptual Commitment)과 환각(Hallucination) 문제를 해결하기 위해 고안되었습니다.#Review#Multimodal Large Language Models#Multi-Agent Framework#Visual Reasoning#Role-Decoupled Optimization#Inference Efficiency2026년 6월 11일댓글 수 로딩 중
[논문리뷰] VideoMDM: Towards 3D Human Motion Generation From 2D Supervision본 연구는 3D Human Motion 데이터셋의 희소성과 구축 비용 문제를 극복하기 위해 2D 영상으로부터 3D 모션을 생성하는 새로운 접근 방식을 제안합니다.#Review#3D Human Motion Generation#Diffusion Models#2D Supervision#Motion Synthesis#Video Analysis2026년 6월 11일댓글 수 로딩 중
[논문리뷰] VIA-SD: Verification via Intra-Model Routing for Speculative Decoding본 논문은 기존의 Speculative Decoding이 가진 이분법적(accept 또는 full recompute) 검증 구조의 한계를 극복하고자 합니다.#Review#Speculative Decoding#Hierarchical Verification#Intra-Model Routing#KL Divergence#LLM Inference#Efficiency#Slim-Verifier2026년 6월 11일댓글 수 로딩 중
[논문리뷰] TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search본 논문은 복잡한 Deep Search 과정에서 에이전트가 단일 선형 궤적을 맹목적으로 따르거나, 체계적인 규칙 없이 분기를 탐색하여 예산을 낭비하는 문제를 해결합니다.#Review#Deep Search#Tree-Structured Search#Tree-Search#TreeMem#Textual UCB#Branch-and-Return#Agentic Workflow2026년 6월 11일댓글 수 로딩 중
[논문리뷰] ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs본 논문은 LLM의 도구 사용 능력을 평가할 때 기존의 End-to-End 방식이 모델의 내부 지식(Parametric Knowledge)과 추론 능력을 명확히 구분하지 못하는 한계를 해결하기 위해 제안되었습니다.#Review#LLM#Tool Learning#Parametric Knowledge#Diagnostic Framework#Tool Auditing#Evaluation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Surflo: Consistent 3D Surface Flow Model with Global State본 연구는 기존의 3D Scene Flow 추정 방식이 가지는 프레임 간의 기하학적 불일치 문제를 해결하는 것을 목표로 합니다. 기존 모델들은 주로 독립적인 프레임 페어 간의 대응 관계를 찾는 데 집중하여, 연속적인 시간 흐름 속에서 누적 오차가 발생하거나 장면의 표면 구조를 왜곡시키는 한계가 있습니다.#Review#3D Scene Flow#Surface Flow#Global State#Point Cloud#Temporal Consistency2026년 6월 11일댓글 수 로딩 중
[논문리뷰] SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling본 연구는 기존의 Off-policy Distillation이 지닌 데이터 고립성 문제와 Teacher-Student 간의 Distribution Mismatch를 해결하는 데 초점을 맞춥니다.#Review#Knowledge Distillation#On-Policy Learning#Sign-Consistency#Phased Teacher Sampling#Large Language Models#Model Alignment2026년 6월 11일댓글 수 로딩 중