[논문리뷰] See2Think: Do Multimodal Models Really Use Intermediate Visual States?본 논문은 Multimodal Large Language Models(MLLMs)가 추론 과정에서 생성하는 중간 시각적 상태가 실제로 문제 해결에 기여하는지 검증하는 것을 목표로 한다.#Review#Multimodal Large Language Models#Chain-of-Thought#Visual Reasoning#Evaluation Framework#Intermediate Visual States#Visual Action-of-Thought2026년 7월 30일댓글 수 로딩 중