[논문리뷰] MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models본 논문은 MLLM이 불완전한 시각적 맥락(Imperfect Context) 하에서 거부와 답변 능력을 적절히 균형 잡지 못하는 신뢰성 문제를 해결하고자 합니다.#Review#Multimodal Large Language Models#Out-of-Context#Benchmark#Refusal#Robust Answering#Shifted In-Context#Model Reliability2026년 8월 10일댓글 수 로딩 중
[논문리뷰] Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark본 연구는 대규모 언어 모델(LLM)이 고등학교 수준의 수학 및 코딩 과제에서는 진전을 보였지만, 현대 물리학 연구에서 발생하는 복잡하고 개방형의 난제들을 얼마나 효과적으로 추론하고 해결할 수 있는지 평가하는 것을 목표로 합니다.#Review#AI Reasoning#Physics Research#LLM Evaluation#Scientific Benchmark#Frontier Physics#Problem Solving#Model Reliability#Auto-grading2025년 10월 1일댓글 수 로딩 중