[논문리뷰] Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models본 논문은 기존 벤치마크에서 우수한 성능을 보이는 최신 멀티모달 모델들이 인간에게는 사소한 작업에서 여전히 실패하는 문제를 해결하고자 한다 . 대규모 언어 모델과 멀티모달 모델은 이미 많은 표준 벤치마크를 거의 포화 상태로 만들었으나, 이러한 점수가 모델의 실질적인 견고성을 항상 대변하지는 않는다.#Review#Multimodal Models#Benchmarking#Blind Spots#Reasoning Evaluation#Task Taxonomy#AI Evaluation2026년 7월 14일댓글 수 로딩 중