[논문리뷰] OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models본 연구는 CUA의 성능 평가와 강화학습에 필수적인 Reward 신호를 생성하는 VLM-as-a-Judge가 과연 신뢰할 수 있는지에 대한 근본적인 의문을 제기한다 .#Review#Computer-Using Agents#Reward Models#VLM-as-a-Judge#Trajectory Evaluation#OSReward#OS-Shepherd#Alignment2026년 8월 6일댓글 수 로딩 중
[논문리뷰] SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use본 논문은 기존의 LLM Agent 평가 방식이 최종적인 Verifier 성공 여부에만 의존하여, 실제 과정상의 비효율이나 부적절한 Skill 사용 방식을 간과하는 문제를 해결하고자 한다.#Review#Agentic Skill-Use#Self-Evolving Rubrics#Process Supervision#Skill Libraries#Trajectory Evaluation#LLM Agents#SFT2026년 7월 2일댓글 수 로딩 중