[논문리뷰] GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI GroundingComputer-use agents는 screenshot을 기반으로 natural-language instructions를 GUI에 grounding하여 interface elements를 찾아냅니다.#Review#GUI Grounding#Spatial Reasoning#Vision-Language Models#Minimal-Pair Evaluation#Computer-Use Agents#Diagnostic Benchmark#Inference-Time Interventions2026년 8월 26일댓글 수 로딩 중
[논문리뷰] WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity본 논문은 기존의 비디오 생성 모델 평가가 주로 Apparent Appearance와 명시적인 지시 사항 이행에만 집중되어 있어, 모델의 Inherent Reactivity를 충분히 검증하지 못한다는 문제 의식에서 출발합니다.#Review#World Models#Video Generation#Inherent Reactivity#Diagnostic Benchmark#Control Adherence#Spatial Consistency#Interaction2026년 8월 3일댓글 수 로딩 중
[논문리뷰] Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning본 논문은 현재의 MLLMs가 비디오 내의 동적인 시각적 증거를 바탕으로 논리적 추론을 수행하는 데 있어 심각한 한계를 가지고 있음을 지적한다.#Review#Video-MME-Logical#Temporal-Logical Reasoning#MLLMs#Diagnostic Benchmark#Programmatic Generation#Intermediate-State Evaluation2026년 6월 29일댓글 수 로딩 중
[논문리뷰] Current World Models Lack a Persistent State Core본 논문은 현대의 World Models가 정교한 프레임을 생성할 수는 있으나, 관찰자가 보고 있지 않을 때에도 독립적으로 진화해야 하는 '지속적인 세계 상태(Persistent State Core)'를 결여하고 있다는 점을 지적합니다.#Review#World Models#Persistent State#Viewpoint Intervention#WRBench#Video Generation#Diagnostic Benchmark#World-State Consistency2026년 6월 18일댓글 수 로딩 중
[논문리뷰] LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models저자들은 로봇 조작 지시문의 핵심 구성 요소인 행동과 객체를 기반으로 43개의 정밀한 변형 유형을 포함하는 LIBERO-Para를 구축하였다. 또한, 모델의 성공 여부뿐만 아니라 원문 지시문과 파라프레이즈 간의 키워드 유사도(SKS_K)와 구조적 유사도(STS_T)를 결합한 PRIDE 메트릭을 제안하여 보다 해석 가능한 견고성 평가를 수행한다 .#Review#Vision-Language-Action (VLA) Models#Paraphrase Robustness#Robotic Manipulation#Diagnostic Benchmark#PRIDE Metric#Object Grounding#Trajectory Divergence2026년 4월 6일댓글 수 로딩 중