[논문리뷰] PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models본 논문은 기존 MLLM 벤치마크가 시각적 인식 능력(Perception)과 고차원적 추론/지식(Reasoning & Knowledge)을 구분하지 못해 발생하는 불명확한 평가 문제를 해결하고자 한다 .#Review#Multimodal Large Language Models#Visual Perception#Benchmark#Atomic Capability#Error Taxonomy#Failure-driven Discovery2026년 7월 28일댓글 수 로딩 중
[논문리뷰] Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis현재 대규모 언어 모델(LLM)이 다단계(multi-hop) 질문 답변 태스크에서 환각(hallucination)을 보이거나 추론에 실패하는 근본적인 원인을 진단하는 것이 주된 목표입니다.#Review#Multi-hop Question Answering#Large Language Models#Reasoning Errors#Error Taxonomy#Human Evaluation#Automated Evaluation#Overthinking2025년 8월 8일댓글 수 로딩 중