[논문리뷰] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization본 논문은 Rubric-based RL에서 발생하는 구조적 피드백과 토큰 단위 최적화 사이의 불일치 문제를 해결합니다. 기존의 GRPO는 구조화된 rubric 평가 결과를 최종적으로 하나의 scalar advantage로 축소한 뒤, 이를 응답 내 모든 토큰에 균등하게 분산시킵니다 .#Review#Reinforcement Learning#Language Models#Credit Assignment#Counterfactual Replay#Rubric-Guided Policy Optimization#GRPO#Instruction Following2026년 7월 29일댓글 수 로딩 중