본문으로 건너뛰기

[논문리뷰] CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

링크: 논문 PDF로 바로 열기

메타데이터

저자: Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo

1. Key Terms & Definitions (핵심 용어 및 정의)

  • GRPO (Group Relative Policy Optimization): 보상 모델 대신 그룹 내 보상의 평균과 표준편차를 사용하여 advantage를 정규화하는 RL 기반 언어 모델 학습 방식입니다.
  • Rubric-based RL: 응답을 단순한 scalar reward로만 평가하지 않고, correctness, formatting 등 구체적인 기준(rubric)을 통해 구조화된 피드백을 활용하는 학습 방식입니다.
  • Counterfactual Replay: 생성된 응답을 그대로 고정한 채, 원본 프롬프트와 criteria-free 프롬프트 사이에서 모델의 log-likelihood 차이를 계산하여 특정 토큰의 rubric 의존도를 추론하는 기법입니다.
  • CoRT (Counterfactual Replay for Token-level credit weighting): 별도의 학습 가능한 scoring 모델 없이, counterfactual contrast를 통해 GRPO advantage를 토큰 단위로 재분배(redistribute)하는 방법론입니다.

2. Motivation & Problem Statement (연구 배경 및 문제 정의)

본 논문은 Rubric-based RL에서 발생하는 구조적 피드백과 토큰 단위 최적화 사이의 불일치 문제를 해결합니다. 기존의 GRPO는 구조화된 rubric 평가 결과를 최종적으로 하나의 scalar advantage로 축소한 뒤, 이를 응답 내 모든 토큰에 균등하게 분산시킵니다 [Figure 2]. 이러한 방식은 응답 내 특정 토큰이 실제 rubric 기준을 충족하는 데 기여했는지 명확히 구분하지 못하는 한계가 있습니다. 이를 해결하기 위해 기존에는 별도의 토큰 단위 relevance model을 학습시키는 방식이 제안되었으나, 이는 파이프라인의 복잡도를 증가시키고 추가적인 학습 단계를 요구합니다. 본 연구는 모델의 policy-internal 신호를 활용하여 추가적인 학습 없이 효율적으로 토큰 단위의 credit assignment를 수행하는 것을 목표로 합니다.

Figure 2: CoRT 전체 파이프라인

Figure 2 — CoRT 전체 파이프라인

3. Method & Key Results (제안 방법론 및 핵심 결과)

본 논문은 CoRT를 제안하여, 동일한 응답을 criteria-free 프롬프트로 재평가(replay)함으로써 얻은 log-probability contrast를 토큰 단위 가중치로 변환합니다 [Figure 1]. 이 contrast는 rubric에 대한 의존도를 나타내는 지표가 되며, CoRT는 이를 response-normalized 가중치로 변환하여 기존 GRPO의 advantage를 토큰별로 재분배합니다 [Figure 2]. 제안 방법론은 별도의 discriminator 학습이 필요 없으며, SmoothStep 스케줄링과 response normalization을 통해 학습 안정성을 보장합니다. 실험 결과, CoRT는 다양한 모델(Qwen3, Qwen2.5) 및 reward setting(CSR, AON)에서 기존 GRPO 대비 평균 4.4%의 성능 향상을 보였으며, 복잡한 relevance-learning 기반 베이스라인(RTT)과 경쟁력 있는 성능을 기록하였습니다 [Table 1]. 특히 DAPOGSPO와 같은 다른 정책 최적화 알고리즘과 결합했을 때도 일관된 성능 향상을 입증하였습니다 [Table 3].

Figure 1: Counterfactual Replay 사례

Figure 1 — Counterfactual Replay 사례

4. Conclusion & Impact (결론 및 시사점)

본 논문은 rubric-based RL에서 모델 자체의 counterfactual likelihood contrast를 활용하여 효율적인 토큰 단위 credit assignment를 가능하게 하는 CoRT를 성공적으로 제시하였습니다. 이 연구는 추가적인 복잡한 모델 아키텍처 없이도 기존 GRPO 프레임워크 내에서 세밀한 학습 신호를 생성할 수 있음을 보여주었습니다. 결과적으로 본 연구는 LLM의 instruction following 능력을 향상시키기 위한 구조화된 피드백 활용 방식의 새로운 방향성을 제시하며, 향후 더 복잡한 에이전트 작업이나 다단계 추론 과정에서의 credit assignment 연구에 기여할 것으로 기대됩니다.

⚠️ 알림: 이 리뷰는 AI로 작성되었습니다.

댓글

관련 포스트

Review 의 다른글