[논문리뷰] UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks본 논문은 현대의 Proactive Agents를 평가하기 위한 기존 벤치마크들의 구조적 한계를 해결하기 위해 UniClawBench를 제안한다. 기존 연구들은 샌드박스화된 고립 환경과 단일 턴(Single-turn) 평가 방식에 의존하여, 실제 환경의 복잡성과 반복적인 사용자 피드백 루프를 반영하지 못한다 .#Review#Proactive Agents#Capability-Oriented Benchmark#Closed-loop Evaluation#Real-World Tasks#Multimodal Understanding#Tool Usage#Docker-based Environment2026년 7월 9일댓글 수 로딩 중
[논문리뷰] Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games본 논문은 MLLM이 현재 눈에 보이는 정보 외에 과거의 관측값을 기억하고 이를 활용해야 하는 Non-Markov 상황에서의 한계를 해결하고자 합니다. 기존 벤치마크들은 은닉 상태를 재구성하는 능력과 다른 에이전트 기술들을 혼재시키거나, 에피소드가 끝난 후 기억을 테스트하는 방식으로 기억력을 제대로 격리하지 못했습니다.#Review#Multimodal Large Language Models#Non-Markov Games#In-context State Tracking#Belief State#Closed-loop Evaluation#Memory Gap2026년 6월 17일댓글 수 로딩 중
[논문리뷰] GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation본 논문은 현대 로봇 학습에서 정책(Policy) 모델의 복잡도는 증가하는 반면, 이를 안정적으로 평가할 수 있는 시뮬레이션 환경이 병목 현상으로 작용하는 문제를 해결하고자 한다.#Review#Robotic Manipulation#Video World Simulator#Action-Conditioned Generation#Closed-loop Evaluation#Proprioceptive State Expert#World Judge2026년 5월 27일댓글 수 로딩 중