[논문리뷰] SHAPE of Chain-of-Thought in Math Reasoning본 연구는 기존의 Chain-of-Thought (CoT) 분석이 주로 답변의 정확도, 토큰 길이, 혹은 표면적인 자가 수정 마커(Self-revision markers)와 같은 피상적인 특성에만 집중하여 모델이 실제로 문제를 '어떻게' 해결하는지에 대한 근본적인 이해가 부족하다는 점을 해결하고자 합니다 .#Review#Chain-of-Thought#Mathematical Reasoning#Semantic Space#Heuristics#Reinforcement Learning#Diagnostic Framework2026년 8월 31일댓글 수 로딩 중
[논문리뷰] Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning본 논문은 MLLM의 추론 성능을 향상하기 위해 이미지 편집 도구를 활용하는 MLLM → Image Editor → MLLM 파이프라인의 실질적인 유용성을 진단하는 데 목적이 있다. 기존 연구들은 시각적 중간 상태가 추론에 도움이 된다고 주장하지만, 모든 태스크가 시각적 편집으로부터 이득을 얻는 것은 아니다.#Review#Multimodal Reasoning#Image Editing#Visual Workspace#MLLM#Task-Conditioned Utility#Diagnostic Framework2026년 8월 27일댓글 수 로딩 중
[논문리뷰] ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs본 논문은 LLM의 도구 사용 능력을 평가할 때 기존의 End-to-End 방식이 모델의 내부 지식(Parametric Knowledge)과 추론 능력을 명확히 구분하지 못하는 한계를 해결하기 위해 제안되었습니다.#Review#LLM#Tool Learning#Parametric Knowledge#Diagnostic Framework#Tool Auditing#Evaluation2026년 6월 11일댓글 수 로딩 중
[논문리뷰] Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to Diagnose Video Hallucination by Fine-grained Spatial-Temporal Grounding본 논문은 대규모 비디오 모델(LVM)이 입력 비디오와 불일치하는 내용을 생성하는 '환각(hallucination)' 문제를 해결하는 것을 목표로 합니다.#Review#Video Hallucination#Large Video Models (LVMs)#Hierarchical Reasoning#Spatial-Temporal Grounding#Diagnostic Framework#Benchmark Dataset#Multimodal AI2025년 9월 16일댓글 수 로딩 중