[논문리뷰] Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios본 연구는 기존 비디오 이해 벤치마크들이 모델의 단순히 '정답 여부'에만 집중하여, 실무에서 요구되는 복잡한 '지시 이행(Instruction Following)' 능력을 과소평가하고 있다는 문제 의식에서 출발합니다.#Review#Multimodal Large Language Models#Video Understanding#Instruction Following#Benchmark#Constraint Satisfaction#Evaluation Protocol2026년 8월 26일댓글 수 로딩 중
[논문리뷰] SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?본 논문은 현대 소프트웨어 생태계의 고질적인 문제인 기술 부채(Technical debt) 해결을 위해 코딩 에이전트가 리포지토리 단위의 마이그레이션을 자율적으로 수행할 수 있는지 검증합니다.#Review#Coding Agents#Software Migration#Technical Debt#Evaluation Protocol#Agentic Verification#Blindness2026년 8월 26일댓글 수 로딩 중
[논문리뷰] TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation기존의 multi-reference image generation 벤치마크는 task-oriented 방식으로 구성되어 combinatorial setting에 부적합하며, 이는 incomplete coverage, no failure diagnosis, 그리고 uncontrolled complexity라는 세 가지 주요 한계를 야기한다.#Review#Multi-Reference Image Generation#Capability-Oriented Benchmark#Diagnostic Tree Analysis#Atomic Operators#Evaluation Protocol#Failure Localization#Compositional Formulas#Attribute Disentanglement2026년 8월 17일댓글 수 로딩 중
[논문리뷰] Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains본 논문은 현재의 비디오 생성 모델들이 시각적 사실성(visual realism)은 향상되었으나, 과학적 메커니즘이나 인과적 법칙을 정확히 반영하는지 검증하기 어렵다는 문제점을 제기한다.#Review#Video Generation#Scientific Reasoning#Benchmark#Evaluation Protocol#Mechanistic Fidelity#MLLM-as-Judge2026년 8월 10일댓글 수 로딩 중
[논문리뷰] From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World본 논문은 기존의 사이버 보안 벤치마크가 지나치게 제한된 환경(예: Capture-the-Flag)에 국한되어 있어, 실제 환경에서의 복잡한 공격 표면과 전략적 탐색 능력을 평가하지 못하는 한계를 해결하고자 한다 .#Review#AI Pentesting Agents#Vulnerability Discovery#Evaluation Protocol#Ground-Truth Matching#Stochasticity#Agentic Workflow2026년 7월 15일댓글 수 로딩 중
[논문리뷰] RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies본 논문은 기존 로봇 매니퓰레이션 벤치마크가 지닌 평가의 단편성과 시뮬레이션-실세계 간의 괴리 문제를 해결하기 위해 RoboDojo를 제안한다.#Review#Robot Manipulation#Generalist Robot Policy#Benchmark#Sim-to-Real#Embodied Intelligence#Evaluation Protocol2026년 7월 8일댓글 수 로딩 중
[논문리뷰] MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation최근 multi-reference image generation 시스템은 하나의 이미지 내에서 여러 entity를 세밀하게 제어하는 기능에 대한 기대를 높이고 있다.#Review#Multi-subject Generation#Attribute Misbinding#Image Generation#Benchmark#Evaluation Protocol#Deep Learning#Computer Vision2026년 3월 24일댓글 수 로딩 중
[논문리뷰] From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM AgentsLLM 기반 시스템은 단일 프롬프트에 응답하는 단순한 챗봇을 넘어, LLM 호출, 정보 검색, 툴 사용, 코드 실행, 메모리 업데이트 및 검증을 통합하는 실행 가능한 워크플로를 구성하여 태스크를 해결하는 방식으로 발전하고 있습니다.#Review#LLM Agents#Workflow Optimization#Agentic Computation Graphs (ACGs)#Static Optimization#Dynamic Optimization#Runtime Adaptation#Evaluation Protocol#Feedback Signals2026년 3월 24일댓글 수 로딩 중