[논문리뷰] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
링크: 논문 PDF로 바로 열기
메타데이터
저자: Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo
1. Key Terms & Definitions (핵심 용어 및 정의)
- GRPO (Group Relative Policy Optimization): 보상 모델 대신 그룹 내 보상의 평균과 표준편차를 사용하여 advantage를 정규화하는 RL 기반 언어 모델 학습 방식입니다.
- Rubric-based RL: 응답을 단순한 scalar reward로만 평가하지 않고, correctness, formatting 등 구체적인 기준(rubric)을 통해 구조화된 피드백을 활용하는 학습 방식입니다.
- Counterfactual Replay: 생성된 응답을 그대로 고정한 채, 원본 프롬프트와 criteria-free 프롬프트 사이에서 모델의 log-likelihood 차이를 계산하여 특정 토큰의 rubric 의존도를 추론하는 기법입니다.
- CoRT (Counterfactual Replay for Token-level credit weighting): 별도의 학습 가능한 scoring 모델 없이, counterfactual contrast를 통해 GRPO advantage를 토큰 단위로 재분배(redistribute)하는 방법론입니다.
2. Motivation & Problem Statement (연구 배경 및 문제 정의)
본 논문은 Rubric-based RL에서 발생하는 구조적 피드백과 토큰 단위 최적화 사이의 불일치 문제를 해결합니다. 기존의 GRPO는 구조화된 rubric 평가 결과를 최종적으로 하나의 scalar advantage로 축소한 뒤, 이를 응답 내 모든 토큰에 균등하게 분산시킵니다 [Figure 2]. 이러한 방식은 응답 내 특정 토큰이 실제 rubric 기준을 충족하는 데 기여했는지 명확히 구분하지 못하는 한계가 있습니다. 이를 해결하기 위해 기존에는 별도의 토큰 단위 relevance model을 학습시키는 방식이 제안되었으나, 이는 파이프라인의 복잡도를 증가시키고 추가적인 학습 단계를 요구합니다. 본 연구는 모델의 policy-internal 신호를 활용하여 추가적인 학습 없이 효율적으로 토큰 단위의 credit assignment를 수행하는 것을 목표로 합니다.

Figure 2 — CoRT 전체 파이프라인
3. Method & Key Results (제안 방법론 및 핵심 결과)
본 논문은 CoRT를 제안하여, 동일한 응답을 criteria-free 프롬프트로 재평가(replay)함으로써 얻은 log-probability contrast를 토큰 단위 가중치로 변환합니다 [Figure 1]. 이 contrast는 rubric에 대한 의존도를 나타내는 지표가 되며, CoRT는 이를 response-normalized 가중치로 변환하여 기존 GRPO의 advantage를 토큰별로 재분배합니다 [Figure 2]. 제안 방법론은 별도의 discriminator 학습이 필요 없으며, SmoothStep 스케줄링과 response normalization을 통해 학습 안정성을 보장합니다. 실험 결과, CoRT는 다양한 모델(Qwen3, Qwen2.5) 및 reward setting(CSR, AON)에서 기존 GRPO 대비 평균 4.4%의 성능 향상을 보였으며, 복잡한 relevance-learning 기반 베이스라인(RTT)과 경쟁력 있는 성능을 기록하였습니다 [Table 1]. 특히 DAPO 및 GSPO와 같은 다른 정책 최적화 알고리즘과 결합했을 때도 일관된 성능 향상을 입증하였습니다 [Table 3].

Figure 1 — Counterfactual Replay 사례
4. Conclusion & Impact (결론 및 시사점)
본 논문은 rubric-based RL에서 모델 자체의 counterfactual likelihood contrast를 활용하여 효율적인 토큰 단위 credit assignment를 가능하게 하는 CoRT를 성공적으로 제시하였습니다. 이 연구는 추가적인 복잡한 모델 아키텍처 없이도 기존 GRPO 프레임워크 내에서 세밀한 학습 신호를 생성할 수 있음을 보여주었습니다. 결과적으로 본 연구는 LLM의 instruction following 능력을 향상시키기 위한 구조화된 피드백 활용 방식의 새로운 방향성을 제시하며, 향후 더 복잡한 에이전트 작업이나 다단계 추론 과정에서의 credit assignment 연구에 기여할 것으로 기대됩니다.
⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.
관련 포스트
- [논문리뷰] TREK: Distill to Explore, Reinforce to Refine
- [논문리뷰] TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- [논문리뷰] STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
- [논문리뷰] FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
- [논문리뷰] VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
Review 의 다른글
- 이전글 [논문리뷰] Can AI agents conduct open-ended AI research? Early evidence from two case studies
- 현재글 : [논문리뷰] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
- 다음글 [논문리뷰] DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
댓글