[논문리뷰] Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models본 논문은 기존 벤치마크에서 우수한 성능을 보이는 최신 멀티모달 모델들이 인간에게는 사소한 작업에서 여전히 실패하는 문제를 해결하고자 한다 . 대규모 언어 모델과 멀티모달 모델은 이미 많은 표준 벤치마크를 거의 포화 상태로 만들었으나, 이러한 점수가 모델의 실질적인 견고성을 항상 대변하지는 않는다.#Review#Multimodal Models#Benchmarking#Blind Spots#Reasoning Evaluation#Task Taxonomy#AI Evaluation2026년 7월 14일댓글 수 로딩 중
[논문리뷰] An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models본 논문은 Large Reasoning Models가 추론 결과 생성에는 탁월한 성능을 보임에도 불구하고, 논리적 오류를 평가하는 능력에서는 심각한 결함을 보이는 Production-Evaluation Gap 문제를 제기한다.#Review#Large Reasoning Models#Production-Evaluation Gap#Answer Confirmation Bias#Reasoning Evaluation#Chain-of-Thought#Causal Patching2026년 6월 14일댓글 수 로딩 중
[논문리뷰] MMGR: Multi-Modal Generative Reasoning본 논문은 대규모 텍스트-투-비디오 모델 평가의 한계, 특히 인지적 충실도를 넘어선 추론 능력 을 평가하는 문제를 해결하고자 합니다.#Review#Multi-Modal Generative Models#Reasoning Evaluation#World Models#Physical Commonsense#Abstract Reasoning#Embodied Navigation#VLM-based Evaluation#Temporal Consistency2025년 12월 16일댓글 수 로딩 중
[논문리뷰] Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization본 논문은 AI, 특히 System-2 유형의 추론 능력 을 정의하고 측정할 명확한 프레임워크가 부족하다는 문제를 제기합니다. 기존의 평가 방식이 주로 System-1 유형의 패턴 인식 에 초점을 맞춰 진정한 추론 능력을 제대로 평가하지 못하는 한계를 극복하고자 합니다.#Review#Complexity OoD Generalization#System-1 Thinking#System-2 Reasoning#Kolmogorov Complexity#Inductive Biases#Large Language Models (LLMs)#Reasoning Evaluation2025년 10월 13일댓글 수 로딩 중