[논문리뷰] OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models본 연구는 CUA의 성능 평가와 강화학습에 필수적인 Reward 신호를 생성하는 VLM-as-a-Judge가 과연 신뢰할 수 있는지에 대한 근본적인 의문을 제기한다 .#Review#Computer-Using Agents#Reward Models#VLM-as-a-Judge#Trajectory Evaluation#OSReward#OS-Shepherd#Alignment2026년 8월 6일댓글 수 로딩 중