[논문리뷰] ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction본 논문은 오픈 엔디드(Open-Ended)한 실제 상호작용 상황에서 기존 Group-based RL이 직면한 '보상 공정성 문제(Reward Fairness Problem)'를 해결하고자 합니다.#Review#Reinforcement Learning#AI Agents#Tool Use#Interaction Strategies#Advantage Estimation2026년 8월 24일댓글 수 로딩 중