[논문리뷰] HarnessEval-W: Agentifying the Evaluation of Visual Worlds본 논문은 기존의 월드 모델 평가 방식이 지닌 불투명성과 정적인 루브릭의 한계를 극복하기 위해 제안되었습니다 . 기존 벤치마크는 평가 과정이 블랙박스처럼 작동하여, 모델이 왜 특정 점수를 받았는지에 대한 근거를 제시하지 못하는 문제가 있습니다.#Review#World Models#Agentic Evaluation#Visual Worlds#Benchmark#Video Generation#Interactive Simulation#Evidence Tree2026년 8월 17일댓글 수 로딩 중