[논문리뷰] Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning본 연구는 기존 오디오 추론 모델이 결과 중심의 보상(Outcome-based rewards)이나 고정된 루브릭 보상(Process-based rewards) 체계 하에서 겪는 한계를 해결하고자 합니다.#Review#Audio Reasoning#Reinforcement Learning#Evolving Rubrics#Large Audio Language Models#Process-based Reward#Audio-grounded Supervision2026년 8월 9일댓글 수 로딩 중